2026 年 7 月 27 日,Moonshot AI 在 Hugging Face 公開 Kimi K3 權重,並在 GitHub 交付首版技術報告。這次值得寫,不是因為 Kimi K3 又發表了一次,而是因為 2.8T MoE、104B activated parameters、原生視覺能力與 1M context,終於從發表會上的規格,變成外界能下載、拆解、載入與反駁的 Kimi K3 權重。
先把最容易混淆的時間線切開:7 月 16 日的 Kimi K3 發布,是產品、API 與 benchmark 登場;7 月 27 日,才是完整推論 checkpoint 與技術報告的實際交付。兩者相差 11 天,新聞價值也完全不同。前者已讓外界透過 hosted API 做初步評估,但底層系統仍由 Moonshot 控制;後者把一個接近封閉前沿規模的 artifact 放到桌上,讓研究者能直接檢查與載入。
社群熱度也在權重落地後快速累積。截至 2026 年 7 月 28 日 21:20(台北時間),Hacker News 討論已有 1,353 points,HN API 顯示 536 descendants;Hugging Face Daily Papers以 212 個 upvotes 排當日第 1。這些數字不能替每位參與者解釋動機,但至少證明:一個可供外界稽核的超大 open-weight artifact,本身就是罕見事件。
下面這張是官方模型頁。點擊截圖會在新分頁開啟 Hugging Face 原頁;接下來我會把權重實物、架構、授權與 benchmark 分開檢驗,最後說清楚我同意什麼、又對什麼保持懷疑。

不是預告兌現的文字遊戲:96 個權重分片真的到了
Moonshot 在 7 月 16 日的官方技術文章裡,曾把期限寫得很明白:
“The full model weights will be released by July 27, 2026.”
中文:「完整模型權重將在 2026 年 7 月 27 日前釋出。」
— Moonshot AI,Kimi K3 技術文章
7 月 27 日台北時間 21:31,Hugging Face 的初始內容 commit出現;當次 revision 已含 96 個 Safetensors 分片。逐檔合計約 1,560,936,091,448 bytes,也就是 1.56 TB(約 1.42 TiB)。HF 的 Safetensors metadata 進一步計出 2,779,931,837,184 個參數,與技術報告表列的 2.78T 對得上。
這個查核很重要,因為「2.8T」是參數量,不是 2.8 TB 檔案;「104B activated」則是一次 forward 中參與計算的架構參數估算,也不是只需要載入 104B 權重。每個 token 在不同層可能路由到不同 experts,完整 expert pool 仍必須位於可存取的部署域裡。

所以,這次 Kimi K3 權重所謂「完整」的最準確意思,是 Moonshot 所稱的完整推論 checkpoint 已公開,而且未設 gated access;它不代表訓練資料、optimizer state、訓練 pipeline 或所有中間 checkpoint 也一併交付。這個邊界不能省略。
報告只列出 Web Text、Code、Mathematics、Knowledge 與視覺資料等大類及概略清理方法,未公開可重建的語料清單、總 token 數、詳細來源與權利資訊。因此,open-weight 不等於 open-data,更不等於外界已能重現整個訓練過程。
2.8T 很大,但 K3 真正想解的是三種資訊流
Moonshot 在模型卡上把 K3 定義得很直接:
“Kimi K3 is an open-weight, native multimodal agentic model and our most capable model to date.”
中文:「Kimi K3 是一個開放權重、原生多模態的 agentic 模型,也是我們迄今能力最強的模型。」
— Kimi K3 Model Card
大數字容易搶走注意力,但技術報告的主軸其實是:如何同時改善序列長度、模型深度與模型寬度上的資訊流。先把規格翻成不容易誤讀的版本:
| 官方規格 | 精確數值 | 真正代表什麼 |
|---|---|---|
| 總參數 | 2.78T | 完整 expert pool 與其他模組的總量 |
| 每 token 啟用 | 104.2B | 一次 forward 涉及的架構參數估算,不是記憶體需求 |
| Transformer layers | 93 | Attention 組成為 69 KDA+24 Gated MLA |
| FFN 組成 | 首層 dense+其餘 92 層 MoE | 每個 attention layer 後都有 FFN;attention 與 MoE 不是二選一 |
| Experts | 896 routed/每 token 選 16 | 每個 sparse layer 另有 2 個 shared experts 持續啟用 |
| Context 上限 | 1,048,576 tokens | 有長上下文訓練,不等於已獨立證明 1M tokens 都能有效利用 |
| 視覺編碼器 | MoonViT-V2,401M | 視覺從訓練期共同最佳化,但仍有獨立 encoder 與 projector |

一、KDA:把大多數長序列歷史壓進 recurrent state
Kimi Delta Attention(KDA)沿著「序列長度」工作。它不是讓每一層都保留完整 token-to-token attention,而是用帶有 forget gate 的 recurrent state 壓縮歷史,降低長序列的 KV cache 壓力。不過 K3 並沒有把 global attention 全刪掉:每三個 KDA 層後仍插入一個 Gated MLA,最後也用 MLA 收尾,形成 69 KDA+24 Gated MLA 的 hybrid architecture。
這表示 1M context 不能只歸功於 KDA。逐步拉長的 long-context training、context parallelism 與專用 kernel 都是重要條件。報告確實描述了從 8K、64K、256K 一路延伸到 1M 的訓練;但「config 支援 1M」與「任意 1M 內容都能精準召回」仍是兩件事,後者還需要獨立長上下文測試。
二、Block AttnRes:不是看更遠,而是從更深的地方取資料
Attention Residuals(AttnRes)處理的是模型「深度」,不是 token 序列。傳統 residual 把歷史壓縮在逐層累積的 hidden state;AttnRes 則學習從先前 representation 中選擇性取回資訊。K3 的實作更精確地說是 Block AttnRes:把 93 層分成 8 個約 12 層的 blocks(末塊不足 12 層),跨 block 聚合 embedding 與先前 block outputs,block 內的後續層再合併當前 block 上一層輸出。它不是「每一層直接看到所有個別前層」。
這是很有研究價值的方向,但 K3 報告沒有提供能單獨隔離出「AttnRes 在 2.8T 規模貢獻多少」的完整 ablation。因此可以確認設計存在,不能把「它已解決深層資訊流」當成獨立事實。
三、Stable LatentMoE:高稀疏度省的是每 token 計算,不是整個模型的重量
每個 sparse layer 有 896 個 routed experts,每個 token 選 16 個,另加 2 個 shared experts。單看 routed experts,16/896 是 1/56;但把 attention、shared experts 與其他模組算進去,104.2B/2.78T 的全模型 activated share 約 3.75%。Stable LatentMoE 還先把 routed path 從 7,168 維降到 3,584 維,再配合 normalization、bounded activation 與 load balancing,讓 896 experts 的訓練不至於失控。
報告所稱約 2.5 倍 scaling efficiency,是 Moonshot 以 held-out OOD validation loss 對 training FLOPs 擬合出的模型家族 scaling-law 結果,來自 KDA、AttnRes、Stable LatentMoE、資料與訓練 recipe 的組合,尚未被獨立重現;它不是 2.8T 模型實測出 2.5 倍推論速度,也不能單獨歸功於某一個模組。同樣地,公開 checkpoint 只有 routed-expert weights 採 MXFP4;attention、shared experts、router、vision tower 等仍維持較高精度,activation 精度也會隨部署後端改變。這正是 2.8T 參數卻仍占 1.56 TB 的原因之一。
「原生多模態」與「1M context」都有架構與訓練依據,但仍有驗證邊界
K3 的 native vision,不是發布後才把一個視覺模組硬接上去;MoonViT-V2、MLP projector 與文字 backbone 在訓練期共同最佳化。報告描述了 image 與 video 訓練,所以稱「原生視覺」有根據;但目前公開的 HF processor 與 SGLang serving contract只接受 image input,會拒絕 video 與 audio。它也不是圖像或影片生成模型。
1M context 同樣不是只把設定檔數字改大。Moonshot 確實做了 progressive extension 與 million-token agentic RL;但報告在 BrowseComp 也透露,91.2 分用了 300K 時觸發的 context compaction,不做 compaction、直接使用原始 1M context 時是 90.4。這個差距不算大,卻提醒我們:長上下文上限、有效召回、context 管理策略,是三個不同問題。想進一步理解為何 context window 不等於記憶,可以搭配閱讀 AlphaLab 的上下文工程完整解說。
它是 open-weight,不是沒有條件的「開源模型」
Kimi K3 是採自訂 Kimi K3 License 發布的 open-weight 模型。這個稱呼比「開源」精確,因為權重確實可下載、可修改、可散布、可部署並建立衍生作品,一般商業用途也沒有被全面禁止;但授權不是 Apache 2.0 或 MIT,而是附帶特定商業門檻的自訂條款。
- 散布 Software 的副本或 substantial portions 時,必須保留 © 2026 Moonshot AI 與 permission notice,使用也須遵守適用法律。
- 授權把 Model as a Service 定義為:讓第三方對推論或 fine-tuning 的輸入、參數或訓練資料有實質控制,例如 API;只把模型能力嵌入特定功能/harness,或單純轉送到別人託管的模型,不算 MaaS。
- 若被授權方(Licensee)或其 affiliates 經營 MaaS,且任何連續 12 個月合計營收超過 2,000 萬美元,將 Software 或衍生作品用於商業用途前須與 Moonshot 另簽協議。
- 若 Software 或衍生作品用於超過 1 億 MAU,或月營收超過 2,000 萬美元的商業產品,使用者介面須醒目顯示「Kimi K3」。
- 內部使用,以及透過 Moonshot 官方產品或認證推論夥伴使用,豁免上述 MaaS 與顯名條件。
因此,「能下載」回答的是技術存取;license 回答的是法律使用邊界;完整訓練資料與可重建 pipeline 是否公開,又是另一層。把這三層混成一個「開源/閉源」二分法,會失去 K3 真正重要的地方。想看這場政策爭論的背景,可延伸讀AI 巨頭捍衛開放權重模型的共同戰線與開放權重政策戰的兩套安全路線。
權重開放的另一面:部署者也接手防護責任
開放權重不只有研究紅利,也會把部分安全責任從模型供應商移到部署者。UK AISI 與美國 CAISI 對 7 月 16 日 hosted model 的初步評估中,K3 在 ExploitBench 得 32%,高於 GLM-5.2 的 24%,但 41 題都未達成任意程式碼執行;在 32 步模擬企業網路攻擊中,K3 平均走到第 17 步,10 次有 1 次完成。
評估也發現,K3 的 safeguards 沒有阻止它嘗試 exploit development 或 offensive cyber operations。不過這份結果不能直接讀成完整 cyber 排名:比較用的美國封閉模型關閉了 system-level safeguards,K3 因託管條件只跑選擇性評估,整體能力估計也只來自 ExploitBench 的 41 題。它是一個需要正視的風險訊號,不是等條件的最終結論。
Hosted API 的 provider-level controls 至少還由供應商維持;open-weight 部署者可以自行修改模型與防護層。這正是 K3 交付後需要同步發展可重現 safety eval、存取控制與監測工具的原因:研究自由增加了,營運責任也沒有憑空消失。
官方 benchmark 很強,但這張表不能直接當模型排名
Moonshot 在技術報告裡其實留了一句難得坦白的話:
“While its overall performance still trails the most powerful proprietary models, namely Claude Fable 5 and GPT-5.6 Sol,”
中文:「儘管它的整體表現仍落後於最強的封閉模型,也就是 Claude Fable 5 與 GPT-5.6 Sol。」
— Kimi K3 Technical Report
但更重要的問題是:報告 Table 2 混合了 Moonshot 自跑結果、第三方榜單、不同 agent harness、不同硬體與不同 context 管理。以 Terminal-Bench 2.1 為例,官方表的 K3 88.3 用 Kimi Code,Sol 88.8 用 Codex,兩者只差 0.5;在Vals 7 月 22 日更新的同 Terminus 2 harness 測試中,K3 是 80.90、Sol 是 85.77,差距擴大到 4.87。這不是證明官方造假,而是證明 benchmark 測到的是模型+harness+工具+context 管理+執行環境的整套系統。
Kimi Code Bench 2.0 與 PerceptionBench 明確屬 Moonshot in-house benchmarks,報告 Table 3 也整體屬內部評估。技術報告沒有披露可供外部審查的 benchmark 去污染分析;這不證明存在資料污染,但官方分數本身也不能排除訓練重疊。
另一個同條件訊號是 DeepSWE 7 月 25 日的 113 題 mini-swe-agent 快照:K3 約 69%±5,與前段班差距在信賴區間內,但目前不是第一。這些獨立 API 層測試支持「K3 接近前沿」,尚不足以支持「K3 已全面超越最強封閉模型」。這也呼應我們先前對Claude Fable 5 能力與 benchmark的判讀:跨模型比較若不固定 harness,漂亮的名次很容易變成測試配置的名次。
權重層面的 Day-0 驗證已經開始。vLLM 載入公開 checkpoint後,在 GPQA-Diamond、MMMU-Pro Vision 等項目得到與官方大致相符的結果;AMD 也在 8 張 MI355X上載入約 1.56 TB checkpoint 並完成 GSM8K 測試。不過 vLLM 與 Moonshot 共同設計過 KDA cache,AMD 測試的 max model length 是 16K;兩者都是有價值的「權重確實能跑」證據,還不是外部團隊對整張 Table 2 與 1M context 的完整重現。
這也是發布後最值得追的事:不是再轉一次官方分數,而是看外部團隊能否用固定 revision、固定 prompt、固定 harness、固定硬體與公開日誌,把每一項結果重跑出來。
可下載,不等於一般人可本機跑
一份 1.56 TB 的 checkpoint,在開始推論前就已超過一般消費級設備的記憶體與儲存舒適區;runtime、recurrent state、KV cache、batch 與通訊還會增加需求。Moonshot 的官方文章為高稀疏 MoE 推論效率建議使用 64 個以上 accelerators 的 supernode。這是推薦拓撲,不是硬性最低配置;生態系已展示用 8 張 MI355X 等頂級加速器載入,但那仍與「在個人桌機上跑」相距甚遠。
MoE 的稀疏度主要降低每個 token 的計算,不會神奇地刪掉其他 experts,也不會消除跨卡路由、記憶體頻寬與同步成本。這正是 K3 最有意思的矛盾:權重的知識存取被打開了,實際操作權卻仍高度集中在有超大記憶體與互連基礎設施的人手上。如果你想從產業層理解這種「能力下放、算力集中」,可以接著讀開源 AI 與封閉 AI 的市場分水嶺。
AlphaLab 的判讀:交付本身,比冠軍表更重要
我的結論很明確:K3 最值得興奮的不是又一張由不同 harness 拼成的冠軍表,而是一個總參數達 2.8T、接近封閉前沿規模的模型,終於以約 1.56 TB 的實際權重接受外界檢驗。Kimi K3 權重的公開讓主張變得可稽核,卻不會自動把官方主張變成獨立事實。
我同意的三件事
- 7 月 27 日是一個真正的交付節點。96 個分片、1.56 TB 實物與可對帳的 2.779T metadata,讓 7 月 16 日的承諾成為可驗證 artifact。
- KDA、Block AttnRes 與 Stable LatentMoE 值得研究。它們分別攻序列、深度與寬度,真正價值可能不只在 K3 本身,而在後續模型如何採用、簡化或反駁這些設計。
- K3 已有接近前沿的外部訊號。同 harness 測試與 Day-0 checkpoint 驗證沒有讓它跌出第一梯隊,只是把「最強」改寫成比較誠實的「frontier-adjacent」。
我仍存疑的三件事
- 公開 checkpoint 能否重現完整官方 benchmark。目前有局部驗證,尚未看到完全獨立、同條件重跑整張主表。
- 1M context 的有效利用率。訓練與架構上限存在,但精準召回、長程工具使用與不靠 compaction 的表現仍需專門測試。
- 開放能否轉化成廣泛部署。自訂授權只是一道門檻;1.56 TB 權重、頂級加速器、互連與專用 kernel,才是多數團隊真正跨不過去的牆。
對架構研究者,下一步是用公開 checkpoint 做行為與系統診斷,並在可承受規模重訓對照模型,檢查 KDA、AttnRes 與 LatentMoE 的 ablation 趨勢能否重現;三者在 2.8T 規模各自貢獻多少,仍需要 Moonshot 提供更完整的對照實驗。對推論團隊,是公布 memory、吞吐、首 token 延遲、長 context correctness 與失敗案例;對應用開發者,短期更務實的路徑仍是先用 API 驗證任務價值,再決定是否值得承擔私有部署。一般開發者則可以觀察 quantization、distillation 與 serving ecosystem,因為真正把 K3 能力帶到更多人手上的,未必是 2.8T 原始 checkpoint,而可能是它之後催生的更小模型與更好的系統設計。
📚 延伸閱讀
- Kimi K3 7 月 16 日產品發布的初步深度解讀
- AI 巨頭為何聯手捍衛開放權重模型?
- 開放權重政策戰:Anthropic 與 NVIDIA 的兩套安全路線
- Context Engineering 上下文工程是什麼?
- 開源 AI 會贏嗎?能力下放與算力集中的分水嶺
真正能替 K3 定位的,不會是發布日那張表,而是接下來幾週一批批可重現的結果。把 revision、harness、硬體、context 策略與成本一起公開,才是這 1.56 TB 權重從「大模型事件」變成「公共研究基礎設施」的關鍵一步。
