2026 年 7 月 16 日,中國 AI 實驗室 Moonshot AI(月之暗面)發布了 Kimi K3——一個總參數量高達 2.8 兆(2.8 trillion)的混合專家(MoE)模型,官方直接稱它是「史上最大的開源模型」,並宣稱在一項前端程式碼排行榜上,把 Anthropic 的旗艦 Claude Fable 5 都比了下去。消息一出,VentureBeat、Tom’s Hardware、Simon Willison 與 Hugging Face 幾乎同時報導,社群一句「開源不再落後閉源半年」被瘋狂轉發。這篇文章,我們用三步走把它講清楚:忠實整理原文 → 逐一查證數字 → 給你一個不吹不貶的獨立判讀。先把 Kimi K3 這則新聞,原原本本擺上桌。

一句話看懂 Kimi K3:一次把「開源 vs 閉源」的前線攤開
Kimi K3 的核心賣點只有一句:它是目前規模最大、且承諾開放權重的前沿模型。2.8 兆參數約是先前最大開源模型 DeepSeek V4 Pro(約 1.6 兆)的 1.75 倍。它同時具備 100 萬(1M)token 的脈絡視窗、原生視覺理解,以及一個官方稱為「thinking mode」的常駐推理模式。Moonshot 把它包裝成「第一個開源的 3 兆級模型」(Simon Willison 吐槽這是把 2.8 兆四捨五入成 3 兆)。
要理解這則新聞的份量,得先知道 Moonshot 從哪裡跌下來。它由清華畢業、曾在 Google 與 Meta 研究的楊植麟(Yang Zhilin)於 2023 年創立,2024 年靠長文本分析爆紅。但 2025 年 1 月 DeepSeek R1 橫空出世,Kimi 的中國月活從第 3 名一路滑到第 7 名。從 Kimi K2(2025 年 7 月)開始轉向開源,就是一場「奪回話語權」的自救。K3 是這條路線的集大成——據報導,趁勢 Moonshot 也正以約 200~300 億美元估值募資、規劃赴港上市(此為進行中的傳聞數字,尚未定案)。這次發布刻意搶在上海「2026 世界人工智慧大會(WAIC)」開幕前,政治意味濃厚。
先把數字擺上桌:2.8 兆參數、1M 脈絡、$3/$15
| 項目 | Kimi K3(官方數字) |
|---|---|
| 總參數 | 2.8 兆(MoE,最大開源模型) |
| 啟用專家 | 896 個中啟用 16 個(約 1.8%),每次推論實際「醒著」的參數約 500 億(A50B) |
| 脈絡視窗 | 1,000,000 tokens |
| 多模態 | 原生視覺/影像理解 |
| 推理 | 常駐 thinking mode,目前只有一檔「max」強度 |
| 架構創新 | Kimi Delta Attention(線性注意力)+ Attention Residuals(皆 Moonshot 自研、自評) |
| 定價 | 輸入 $3/百萬 tokens、輸出 $15/百萬、快取輸入 $0.30/百萬 |
| 開放權重 | 承諾於 2026/7/27 釋出(發文時尚未開放,只能用網站與 API) |
兩個數字值得先記住。第一,「2.8 兆」是總參數,不是每次都全開——MoE 架構每次只點亮 896 個專家中的 16 個,實際運算量約當一個 500 億參數的模型。第二,$3/$15 的定價直接對齊 Anthropic 的 Claude Sonnet 系列,是中國實驗室至今最貴的模型,比自家 Kimi K2.6($0.95/$4)貴了一大截。這個定價本身就是一則訊號,稍後再談。
它「贏過 Claude」了嗎?答案藏在賽道裡
這是整則新聞最容易被誤讀的地方,也是最該講清楚的一點。Kimi K3 確實在 Arena.ai 的「前端程式碼競技場(Frontend Code Arena)」拿下第一名,分數 1,679,領先 Claude Fable 5(1,631)與 GPT-5.6 Sol(1,618)。重點是:這是一個由真人盲測投票決定的排行榜——不是廠商自評,而是相對獨立的第三方人類偏好數據。這個「贏」是真的。
但把鏡頭拉遠,故事就翻轉了。在綜合能力的榜單上,K3 並沒有站上頂點。以涵蓋 44 種職業、9 大產業的 GDPval-AA v2 為例,Fable 5 Max(1,815)與 GPT-5.6 Sol Max(1,748)都明顯在前,K3(1,687)排第三,僅小勝 Claude Opus 4.8(1,600);在 Artificial Analysis 綜合智慧指標上,K3 約落在第四。同一個模型,兩張榜,兩個世界。

連 Simon Willison 引述官方數字時,也講得很白:
“Their self-reported benchmarks have K3 mostly beating Claude Opus 4.8 max and GPT-5.5 high, while losing out to Claude Fable 5 and GPT-5.6 Sol.”
中文:他們自評的跑分裡,K3 大致贏過 Claude Opus 4.8 max 與 GPT-5.5 high,但輸給 Claude Fable 5 與 GPT-5.6 Sol。
Simon Willison,2026/7/16
換句話說:「K3 打敗 Claude」正確,但只在前端程式碼這一條賽道上成立;論綜合實力,它是最強的開源模型,卻還不是最強的模型。這兩件事的差距,就是整篇報導的張力所在。
原文的兩種聲音:一邊喊分水嶺,一邊潑冷水
VentureBeat 的定調是「分水嶺時刻」。文中引述一位高關注度的 AI 評論者,把興奮濃縮成一句:
“Open source is no longer lagging six months behind Western closed-source models. Read that again, and think about what it all means.”
中文:開源已經不再落後西方閉源模型半年了。這句話請再讀一遍,然後想想它意味著什麼。
引自 VentureBeat 報導
另一邊,Simon Willison 用他知名的「鵜鶘騎腳踏車」測試(要模型畫一張 SVG)順手替 K3 潑了盆理性的冷水。這次的鵜鶘花了 95 個輸入 token、16,658 個輸出 token(其中 13,241 個是推理 token),一張圖成本高達 25 美分——因為 K3 目前只有「max」一檔推理強度,話很多、也很貴。但他真正的重點是方法論:
“So don’t go using pelicans to compare models! … The biggest limitation of the pelican is that it doesn’t touch at all on the thing that matters most for today’s model: agentic tool calling and the ability to operate tools reliably as conversations grow in length.”
中文:所以別再拿鵜鶘來比較模型了!……鵜鶘測試最大的侷限,是它完全碰不到當今模型最重要的能力:agent 式的工具呼叫,以及在對話越拉越長時仍能可靠操作工具。
Simon Willison
這句話其實比任何跑分都關鍵:真正的戰場,早已從「單題答得好不好」轉向「能不能長時間、跨多步驟地自己把事情做完」。Moonshot 也是這樣賣 K3 的——它秀了一段「48 小時自主設計晶片」的展示:讓 K3 用開源 EDA 工具,從架構、最佳化到驗證,獨立完成一顆 4 平方毫米、時脈收斂在 100MHz 的晶片設計。數字很唬人,但務必記得:這是 Moonshot 的官方展示、模擬環境下的成績,尚無獨立第三方複現,看看就好,別當定論。
AlphaLab 的判讀
判讀一:「贏過 Claude」是真的,但別過度外推
前端程式碼競技場的第一名,價值在於它是真人投票,不是自評——這是這次發布中最硬的一塊證據。但「前端程式碼」剛好也是「看起來對不對,人眼很容易判斷」的領域,人類偏好榜在這種任務上,容易獎勵「產出漂亮、能跑」的模型。它證明 K3 在生成 UI/網頁這件事上真的頂尖,卻不能直接翻譯成「K3 綜合最強」。把單一賽道的冠軍,講成全能王,是這則新聞最大的認知陷阱。
判讀二:開源 ≠ 你跑得動
「開放權重」聽起來像「人人可用」,但 2.8 兆參數的模型,即使用 4-bit 量化,權重檔也逼近 1.4TB——Simon Willison 平常能在 128GB 的 MacBook 上跑開源模型,K3 完全塞不進去。VentureBeat 也直言:「2.8 兆參數的推論,不是單一機櫃跑得起來的事。」所以對絕大多數個人與中小企業,K3 的「開源」實際意義比較接近地緣政治與社群號召:向世界證明中國能做出最大的開源模型、把開發者生態拉到自己這邊,而不是「你今天就能自己 host」。要用,大概率還是走 API。
判讀三:真正的期末考在 7/27
發文當下(7 月中),你看到的所有跑分,幾乎都是Moonshot 自評或委託評測,而且權重還沒開放。真正的獨立驗證,要等 7/27 全量權重釋出、社群拿去自己重跑之後才算數。連授權條款也還沒正式公布——市場預期會沿用 K2 系列的「Modified MIT」,但這在發文時仍未確認。一句話:先把 K3 當成「一份很有份量的宣稱」,7/27 之後再對帳。這也是這則新聞最值得追蹤的falsifiable 時間點。
判讀四:比分數更重要的訊號——差距在縮短
就算 K3 綜合只排第三、第四,真正該讓人坐直身子的,是差距的量級。過去三年,開源模型通常落後閉源一大截;如今 K3 已經能和 Fable 5、GPT-5.6 Sol 在同一張表上、用個位數的差距對話。開源與閉源的能力鴻溝,正在從「代差」壓縮成「版本差」。這才是「開源不再落後半年」那句話真正想講的東西——不是 K3 贏了,而是牌桌上再也沒有絕對安全的領先。想更完整理解這場結構性拉鋸,可以延伸讀我們的 〈AI 開源 vs 閉源:算力集中、能力下放〉。
判讀五:$3/$15 的定價,才是最大膽的一步
大家盯著參數量,卻少有人談定價。K3 開出中國實驗室史上最貴的價格,等於在說:「我不打價格戰,我要跟 Anthropic、OpenAI 站在同一個價位帶競爭。」對一家剛從谷底爬回來的公司,這是自信、也是豪賭——它把自己的商業模式,從「用低價換市佔」升級成「用能力賣溢價」。定價策略,往往比跑分更誠實地透露一家公司如何看待自己的產品。
我同意什麼、我存疑什麼
- 我同意:K3 是目前最強的開源模型、在前端程式碼上確實世界頂尖(真人投票背書),而且「開源正在逼近閉源前沿」是真實且重要的趨勢訊號。
- 我存疑:「打敗 Claude/史上最強」的簡化說法(僅單一賽道成立)、「開源=人人可用」(1.4TB 跑不動)、以及所有尚未被獨立複現的自評跑分與晶片展示。這些在 7/27 權重開放前,都只能算「待驗證」。
那你該怎麼看、怎麼用?
- 把它加進你的工具箱,但按賽道用。要生成前端/UI、寫網頁、跑長脈絡(1M token)的任務,K3 值得一試;要最頂的綜合推理與數學,Fable 5、GPT-5.6 Sol 仍在前面。用對地方,才划算。
- 算清楚「推理稅」。K3 只有 max 一檔,話多又貴(一張鵜鶘 25 美分)。做高頻、低複雜度的任務前,先估 token 成本,別被 $3/$15 的表面價格騙了。想省 token,可延伸讀 〈上下文工程:把情境視窗當 RAM 來管理〉。
- 7/27 之後再下結論。權重開放前,所有排名都先打個問號;開放後留意社群的獨立複現與量化版本,那才是它能不能真正「開源普及」的關鍵。
- 看懂這盤更大的棋。K3 是開源 vs 閉源、也是中美 AI 競賽的一個切片。搭配 開源 vs 閉源市場、Claude Fable 5 這一代閉源旗艦 與 各國的 AI 國家隊佈局 一起看,訊號會清楚得多。它的對手 Kimi Code(對標 Claude Code 的 agent 團隊玩法)同日更新,也說明真正的戰場是 agent,不是單題跑分。
📚 延伸閱讀
- AI 開源 vs 閉源:算力集中、能力下放的下一場拉鋸
- Claude Fable 5 完整解析:這一代閉源旗艦強在哪
- 上下文工程是什麼:把 1M 脈絡視窗當 RAM 來管理
- 一個 Repo=一間 AI 公司:Claude Code 的子代理團隊
- 南韓 8,800 億美元 AI 計畫:國家隊如何下注
免責聲明:本文為 AlphaLab 的獨立評論與整理,非任何形式之投資或採購建議。文中引用之數據、圖表與原文引句版權歸原始出處(VentureBeat、Simon Willison、Arena.ai、Artificial Analysis、Moonshot AI)所有,僅為評論目的引用。多數跑分為廠商自評或委託評測,且 Kimi K3 權重於 2026/7/27 才開放,發文時尚無法完全獨立複現,請讀者自行對帳查證。本文與 Moonshot AI 無任何贊助或利益關係。
