Kimi K3 權重正式落地:2.8T 可下載,為何仍不是人人可跑?(2026)

最後更新: ·
Kimi K3 權重正式交付專題首圖,以 Moonshot AI 官方磁力線視覺搭配 2.8T 權重與 1.56 TB 訊號。

2026 年 7 月 27 日,Moonshot AI 在 Hugging Face 公開 Kimi K3 權重,並在 GitHub 交付首版技術報告。這次值得寫,不是因為 Kimi K3 又發表了一次,而是因為 2.8T MoE、104B activated parameters、原生視覺能力與 1M context,終於從發表會上的規格,變成外界能下載、拆解、載入與反駁的 Kimi K3 權重

先把最容易混淆的時間線切開:7 月 16 日的 Kimi K3 發布,是產品、API 與 benchmark 登場;7 月 27 日,才是完整推論 checkpoint 與技術報告的實際交付。兩者相差 11 天,新聞價值也完全不同。前者已讓外界透過 hosted API 做初步評估,但底層系統仍由 Moonshot 控制;後者把一個接近封閉前沿規模的 artifact 放到桌上,讓研究者能直接檢查與載入。

社群熱度也在權重落地後快速累積。截至 2026 年 7 月 28 日 21:20(台北時間),Hacker News 討論已有 1,353 points,HN API 顯示 536 descendants;Hugging Face Daily Papers以 212 個 upvotes 排當日第 1。這些數字不能替每位參與者解釋動機,但至少證明:一個可供外界稽核的超大 open-weight artifact,本身就是罕見事件。

下面這張是官方模型頁。點擊截圖會在新分頁開啟 Hugging Face 原頁;接下來我會把權重實物、架構、授權與 benchmark 分開檢驗,最後說清楚我同意什麼、又對什麼保持懷疑。

Hugging Face 上的 Moonshot AI Kimi K3 模型頁,顯示 2.8T parameters 與自訂 Kimi K3 授權。
Kimi K3 官方 Hugging Face 模型頁;頁面直接標示 2.8T parameters 與 Kimi K3 自訂授權。點擊圖片可閱讀原頁。

不是預告兌現的文字遊戲:96 個權重分片真的到了

Moonshot 在 7 月 16 日的官方技術文章裡,曾把期限寫得很明白:

“The full model weights will be released by July 27, 2026.”

中文:「完整模型權重將在 2026 年 7 月 27 日前釋出。」

Moonshot AI,Kimi K3 技術文章

7 月 27 日台北時間 21:31,Hugging Face 的初始內容 commit出現;當次 revision 已含 96 個 Safetensors 分片。逐檔合計約 1,560,936,091,448 bytes,也就是 1.56 TB(約 1.42 TiB)。HF 的 Safetensors metadata 進一步計出 2,779,931,837,184 個參數,與技術報告表列的 2.78T 對得上。

這個查核很重要,因為「2.8T」是參數量,不是 2.8 TB 檔案;「104B activated」則是一次 forward 中參與計算的架構參數估算,也不是只需要載入 104B 權重。每個 token 在不同層可能路由到不同 experts,完整 expert pool 仍必須位於可存取的部署域裡。

Kimi K3 的 Hugging Face Files 頁面顯示模型 repository 大小為 1.56 TB。
Kimi K3 的 Hugging Face 檔案樹顯示 repository 約 1.56 TB;初始 revision 已包含 96 個權重分片。點擊圖片可檢視檔案。

所以,這次 Kimi K3 權重所謂「完整」的最準確意思,是 Moonshot 所稱的完整推論 checkpoint 已公開,而且未設 gated access;它不代表訓練資料、optimizer state、訓練 pipeline 或所有中間 checkpoint 也一併交付。這個邊界不能省略。

報告只列出 Web Text、Code、Mathematics、Knowledge 與視覺資料等大類及概略清理方法,未公開可重建的語料清單、總 token 數、詳細來源與權利資訊。因此,open-weight 不等於 open-data,更不等於外界已能重現整個訓練過程。


2.8T 很大,但 K3 真正想解的是三種資訊流

Moonshot 在模型卡上把 K3 定義得很直接:

“Kimi K3 is an open-weight, native multimodal agentic model and our most capable model to date.”

中文:「Kimi K3 是一個開放權重、原生多模態的 agentic 模型,也是我們迄今能力最強的模型。」

Kimi K3 Model Card

大數字容易搶走注意力,但技術報告的主軸其實是:如何同時改善序列長度、模型深度與模型寬度上的資訊流。先把規格翻成不容易誤讀的版本:

官方規格精確數值真正代表什麼
總參數2.78T完整 expert pool 與其他模組的總量
每 token 啟用104.2B一次 forward 涉及的架構參數估算,不是記憶體需求
Transformer layers93Attention 組成為 69 KDA+24 Gated MLA
FFN 組成首層 dense+其餘 92 層 MoE每個 attention layer 後都有 FFN;attention 與 MoE 不是二選一
Experts896 routed/每 token 選 16每個 sparse layer 另有 2 個 shared experts 持續啟用
Context 上限1,048,576 tokens有長上下文訓練,不等於已獨立證明 1M tokens 都能有效利用
視覺編碼器MoonViT-V2,401M視覺從訓練期共同最佳化,但仍有獨立 encoder 與 projector
Kimi K3 技術報告的架構圖,左側拆解 Stable LatentMoE 與 Kimi Delta Attention,右側呈現 KDA、Gated MLA、AttnRes 和視覺輸入路徑。
Kimi K3 架構把資訊流拆成三個方向:KDA 處理序列、Block AttnRes 處理深度、Stable LatentMoE 處理寬度;右下是 MoonViT-V2 視覺路徑。圖取自技術報告 Figure 2,© 2026 Moonshot AI,依 Kimi K3 License 呈現。

一、KDA:把大多數長序列歷史壓進 recurrent state

Kimi Delta Attention(KDA)沿著「序列長度」工作。它不是讓每一層都保留完整 token-to-token attention,而是用帶有 forget gate 的 recurrent state 壓縮歷史,降低長序列的 KV cache 壓力。不過 K3 並沒有把 global attention 全刪掉:每三個 KDA 層後仍插入一個 Gated MLA,最後也用 MLA 收尾,形成 69 KDA+24 Gated MLA 的 hybrid architecture。

這表示 1M context 不能只歸功於 KDA。逐步拉長的 long-context training、context parallelism 與專用 kernel 都是重要條件。報告確實描述了從 8K、64K、256K 一路延伸到 1M 的訓練;但「config 支援 1M」與「任意 1M 內容都能精準召回」仍是兩件事,後者還需要獨立長上下文測試。

二、Block AttnRes:不是看更遠,而是從更深的地方取資料

Attention Residuals(AttnRes)處理的是模型「深度」,不是 token 序列。傳統 residual 把歷史壓縮在逐層累積的 hidden state;AttnRes 則學習從先前 representation 中選擇性取回資訊。K3 的實作更精確地說是 Block AttnRes:把 93 層分成 8 個約 12 層的 blocks(末塊不足 12 層),跨 block 聚合 embedding 與先前 block outputs,block 內的後續層再合併當前 block 上一層輸出。它不是「每一層直接看到所有個別前層」。

這是很有研究價值的方向,但 K3 報告沒有提供能單獨隔離出「AttnRes 在 2.8T 規模貢獻多少」的完整 ablation。因此可以確認設計存在,不能把「它已解決深層資訊流」當成獨立事實。

三、Stable LatentMoE:高稀疏度省的是每 token 計算,不是整個模型的重量

每個 sparse layer 有 896 個 routed experts,每個 token 選 16 個,另加 2 個 shared experts。單看 routed experts,16/896 是 1/56;但把 attention、shared experts 與其他模組算進去,104.2B/2.78T 的全模型 activated share 約 3.75%。Stable LatentMoE 還先把 routed path 從 7,168 維降到 3,584 維,再配合 normalization、bounded activation 與 load balancing,讓 896 experts 的訓練不至於失控。

報告所稱約 2.5 倍 scaling efficiency,是 Moonshot 以 held-out OOD validation loss 對 training FLOPs 擬合出的模型家族 scaling-law 結果,來自 KDA、AttnRes、Stable LatentMoE、資料與訓練 recipe 的組合,尚未被獨立重現;它不是 2.8T 模型實測出 2.5 倍推論速度,也不能單獨歸功於某一個模組。同樣地,公開 checkpoint 只有 routed-expert weights 採 MXFP4;attention、shared experts、router、vision tower 等仍維持較高精度,activation 精度也會隨部署後端改變。這正是 2.8T 參數卻仍占 1.56 TB 的原因之一。


「原生多模態」與「1M context」都有架構與訓練依據,但仍有驗證邊界

K3 的 native vision,不是發布後才把一個視覺模組硬接上去;MoonViT-V2、MLP projector 與文字 backbone 在訓練期共同最佳化。報告描述了 image 與 video 訓練,所以稱「原生視覺」有根據;但目前公開的 HF processor 與 SGLang serving contract只接受 image input,會拒絕 video 與 audio。它也不是圖像或影片生成模型。

1M context 同樣不是只把設定檔數字改大。Moonshot 確實做了 progressive extension 與 million-token agentic RL;但報告在 BrowseComp 也透露,91.2 分用了 300K 時觸發的 context compaction,不做 compaction、直接使用原始 1M context 時是 90.4。這個差距不算大,卻提醒我們:長上下文上限、有效召回、context 管理策略,是三個不同問題。想進一步理解為何 context window 不等於記憶,可以搭配閱讀 AlphaLab 的上下文工程完整解說


它是 open-weight,不是沒有條件的「開源模型」

Kimi K3 是採自訂 Kimi K3 License 發布的 open-weight 模型。這個稱呼比「開源」精確,因為權重確實可下載、可修改、可散布、可部署並建立衍生作品,一般商業用途也沒有被全面禁止;但授權不是 Apache 2.0 或 MIT,而是附帶特定商業門檻的自訂條款。

  • 散布 Software 的副本或 substantial portions 時,必須保留 © 2026 Moonshot AI 與 permission notice,使用也須遵守適用法律。
  • 授權把 Model as a Service 定義為:讓第三方對推論或 fine-tuning 的輸入、參數或訓練資料有實質控制,例如 API;只把模型能力嵌入特定功能/harness,或單純轉送到別人託管的模型,不算 MaaS。
  • 若被授權方(Licensee)或其 affiliates 經營 MaaS,且任何連續 12 個月合計營收超過 2,000 萬美元,將 Software 或衍生作品用於商業用途前須與 Moonshot 另簽協議。
  • 若 Software 或衍生作品用於超過 1 億 MAU,或月營收超過 2,000 萬美元的商業產品,使用者介面須醒目顯示「Kimi K3」。
  • 內部使用,以及透過 Moonshot 官方產品或認證推論夥伴使用,豁免上述 MaaS 與顯名條件。

因此,「能下載」回答的是技術存取;license 回答的是法律使用邊界;完整訓練資料與可重建 pipeline 是否公開,又是另一層。把這三層混成一個「開源/閉源」二分法,會失去 K3 真正重要的地方。想看這場政策爭論的背景,可延伸讀AI 巨頭捍衛開放權重模型的共同戰線開放權重政策戰的兩套安全路線

權重開放的另一面:部署者也接手防護責任

開放權重不只有研究紅利,也會把部分安全責任從模型供應商移到部署者。UK AISI 與美國 CAISI 對 7 月 16 日 hosted model 的初步評估中,K3 在 ExploitBench 得 32%,高於 GLM-5.2 的 24%,但 41 題都未達成任意程式碼執行;在 32 步模擬企業網路攻擊中,K3 平均走到第 17 步,10 次有 1 次完成。

評估也發現,K3 的 safeguards 沒有阻止它嘗試 exploit development 或 offensive cyber operations。不過這份結果不能直接讀成完整 cyber 排名:比較用的美國封閉模型關閉了 system-level safeguards,K3 因託管條件只跑選擇性評估,整體能力估計也只來自 ExploitBench 的 41 題。它是一個需要正視的風險訊號,不是等條件的最終結論。

Hosted API 的 provider-level controls 至少還由供應商維持;open-weight 部署者可以自行修改模型與防護層。這正是 K3 交付後需要同步發展可重現 safety eval、存取控制與監測工具的原因:研究自由增加了,營運責任也沒有憑空消失。


官方 benchmark 很強,但這張表不能直接當模型排名

Moonshot 在技術報告裡其實留了一句難得坦白的話:

“While its overall performance still trails the most powerful proprietary models, namely Claude Fable 5 and GPT-5.6 Sol,”

中文:「儘管它的整體表現仍落後於最強的封閉模型,也就是 Claude Fable 5 與 GPT-5.6 Sol。」

Kimi K3 Technical Report

但更重要的問題是:報告 Table 2 混合了 Moonshot 自跑結果、第三方榜單、不同 agent harness、不同硬體與不同 context 管理。以 Terminal-Bench 2.1 為例,官方表的 K3 88.3 用 Kimi Code,Sol 88.8 用 Codex,兩者只差 0.5;在Vals 7 月 22 日更新的同 Terminus 2 harness 測試中,K3 是 80.90、Sol 是 85.77,差距擴大到 4.87。這不是證明官方造假,而是證明 benchmark 測到的是模型+harness+工具+context 管理+執行環境的整套系統。

Kimi Code Bench 2.0 與 PerceptionBench 明確屬 Moonshot in-house benchmarks,報告 Table 3 也整體屬內部評估。技術報告沒有披露可供外部審查的 benchmark 去污染分析;這不證明存在資料污染,但官方分數本身也不能排除訓練重疊。

另一個同條件訊號是 DeepSWE 7 月 25 日的 113 題 mini-swe-agent 快照:K3 約 69%±5,與前段班差距在信賴區間內,但目前不是第一。這些獨立 API 層測試支持「K3 接近前沿」,尚不足以支持「K3 已全面超越最強封閉模型」。這也呼應我們先前對Claude Fable 5 能力與 benchmark的判讀:跨模型比較若不固定 harness,漂亮的名次很容易變成測試配置的名次。

權重層面的 Day-0 驗證已經開始。vLLM 載入公開 checkpoint後,在 GPQA-Diamond、MMMU-Pro Vision 等項目得到與官方大致相符的結果;AMD 也在 8 張 MI355X上載入約 1.56 TB checkpoint 並完成 GSM8K 測試。不過 vLLM 與 Moonshot 共同設計過 KDA cache,AMD 測試的 max model length 是 16K;兩者都是有價值的「權重確實能跑」證據,還不是外部團隊對整張 Table 2 與 1M context 的完整重現。

這也是發布後最值得追的事:不是再轉一次官方分數,而是看外部團隊能否用固定 revision、固定 prompt、固定 harness、固定硬體與公開日誌,把每一項結果重跑出來。


可下載,不等於一般人可本機跑

一份 1.56 TB 的 checkpoint,在開始推論前就已超過一般消費級設備的記憶體與儲存舒適區;runtime、recurrent state、KV cache、batch 與通訊還會增加需求。Moonshot 的官方文章為高稀疏 MoE 推論效率建議使用 64 個以上 accelerators 的 supernode。這是推薦拓撲,不是硬性最低配置;生態系已展示用 8 張 MI355X 等頂級加速器載入,但那仍與「在個人桌機上跑」相距甚遠。

MoE 的稀疏度主要降低每個 token 的計算,不會神奇地刪掉其他 experts,也不會消除跨卡路由、記憶體頻寬與同步成本。這正是 K3 最有意思的矛盾:權重的知識存取被打開了,實際操作權卻仍高度集中在有超大記憶體與互連基礎設施的人手上。如果你想從產業層理解這種「能力下放、算力集中」,可以接著讀開源 AI 與封閉 AI 的市場分水嶺


AlphaLab 的判讀:交付本身,比冠軍表更重要

我的結論很明確:K3 最值得興奮的不是又一張由不同 harness 拼成的冠軍表,而是一個總參數達 2.8T、接近封閉前沿規模的模型,終於以約 1.56 TB 的實際權重接受外界檢驗。Kimi K3 權重的公開讓主張變得可稽核,卻不會自動把官方主張變成獨立事實。

我同意的三件事

  • 7 月 27 日是一個真正的交付節點。96 個分片、1.56 TB 實物與可對帳的 2.779T metadata,讓 7 月 16 日的承諾成為可驗證 artifact。
  • KDA、Block AttnRes 與 Stable LatentMoE 值得研究。它們分別攻序列、深度與寬度,真正價值可能不只在 K3 本身,而在後續模型如何採用、簡化或反駁這些設計。
  • K3 已有接近前沿的外部訊號。同 harness 測試與 Day-0 checkpoint 驗證沒有讓它跌出第一梯隊,只是把「最強」改寫成比較誠實的「frontier-adjacent」。

我仍存疑的三件事

  • 公開 checkpoint 能否重現完整官方 benchmark。目前有局部驗證,尚未看到完全獨立、同條件重跑整張主表。
  • 1M context 的有效利用率。訓練與架構上限存在,但精準召回、長程工具使用與不靠 compaction 的表現仍需專門測試。
  • 開放能否轉化成廣泛部署。自訂授權只是一道門檻;1.56 TB 權重、頂級加速器、互連與專用 kernel,才是多數團隊真正跨不過去的牆。

對架構研究者,下一步是用公開 checkpoint 做行為與系統診斷,並在可承受規模重訓對照模型,檢查 KDA、AttnRes 與 LatentMoE 的 ablation 趨勢能否重現;三者在 2.8T 規模各自貢獻多少,仍需要 Moonshot 提供更完整的對照實驗。對推論團隊,是公布 memory、吞吐、首 token 延遲、長 context correctness 與失敗案例;對應用開發者,短期更務實的路徑仍是先用 API 驗證任務價值,再決定是否值得承擔私有部署。一般開發者則可以觀察 quantization、distillation 與 serving ecosystem,因為真正把 K3 能力帶到更多人手上的,未必是 2.8T 原始 checkpoint,而可能是它之後催生的更小模型與更好的系統設計。

📚 延伸閱讀

真正能替 K3 定位的,不會是發布日那張表,而是接下來幾週一批批可重現的結果。把 revision、harness、硬體、context 策略與成本一起公開,才是這 1.56 TB 權重從「大模型事件」變成「公共研究基礎設施」的關鍵一步。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。