Inkling-Small 完整權重釋出:12B active 真的追上 975B Inkling?(2026)

最後更新: ·
Inkling-Small 完整權重釋出,12B active 代價在哪主視覺

2026 年 7 月 30 日,Thinking Machines 在官方公告〈Introducing Inkling-Small〉釋出 Inkling-Small 完整權重:官方把它標成 276B 總參數、每個 token 啟用 12B 參數的多模態 MoE,最高 context 設定為 1M tokens,並能以同一模型接收文字、圖片與音訊。最吸睛的不是「Small」這個名字,而是一個更難回答的問題:它真的用小得多的 active 規模,追上 975B/41B active 的大型 Inkling 了嗎?

先把日期釐清。7 月 15 日的 Inkling 公告只預告 Inkling-Small preview;本輪的新事件,是 7 月 30 日釋出的 full weights。關注度確實不低:截至 2026 年 8 月 2 日擷取,官方 X 貼文約有 140.3 萬次觀看、3,212 個 likes;Hugging Face 模型頁則顯示 209 個 likes、過去一個月 3,998 次 downloads。這些是會變動的平台計數,只能說明市場正在看,不能證明模型已被 4,000 個團隊完整部署。

Thinking Machines 於 2026 年 7 月 30 日發布 Inkling-Small 完整權重的官方公告頁面
Thinking Machines 的 Inkling-Small 官方公告,日期為 2026 年 7 月 30 日;點圖可閱讀原文。

Inkling-Small 完整權重,究竟交出了什麼?

這不是只多一個雲端 API 名稱。官方同時提供可下載 checkpoint、Tinker 微調入口,以及 Tinker Playground 的文字/圖片/音訊對話。模型輸入可跨三種模態,但輸出仍是文字;「多模態」不等於它會生成圖片或聲音。

項目已公開規格讀法與限制
架構42 層 decoder;權重索引顯示 40 層採 MoE FFN、2 層採 dense FFN。每個 MoE 層由 256 個 routed experts 選 6 個,另啟用 2 個 shared experts12B active 描述每次推理啟用的參數,不是下載大小
參數官方標示 276B total/12B activeHF Hub 的 safetensors metadata 對目前 checkpoint 計數為 265,956,439,090 個 tensor elements,頁面四捨五入顯示 266B;截至 2026 年 8 月 2 日,官方公告與模型卡未說明兩種計數口徑的差異
Context設定上限 1,048,576 tokens上限設定不等於每個服務端點都會開滿,也不證明模型在整段 1M context 都能維持相同品質
多模態文字、圖片、音訊輸入;文字輸出圖片以 40×40 patches 處理;音訊由 dMel spectrogram 表示
Reasoning effort模型以 [0,1) 的連續 scalar conditioning;Tinker presets 為 none/minimal/low/medium/high/xhigh,HF chat template 把最高檔命名為 max=0.99實際參數名稱依 serving stack;提高 effort 也不保證每一道題都必然更準
官方參數比較圖:Inkling-Small 標示 276B 總參數與 12B active,Inkling 為 975B 與 41B active
官方的參數比較圖。每個 token 只啟用部分 experts,但整套服務仍須儲存並在裝置或主機間配置全部 weight shards,不能只載入 12B active 部分。

「完整權重」也要精確理解。Hugging Face 上的 BF16 主權重加上 MTP 權重,合計約 531.9 GB(約 495.4 GiB);另一路 NVFP4 mixed-precision checkpoint 約 170.7 GB(約 159.0 GiB),其 quant config 排除了部分 attention、多模態與 routing 模組,KV cache 預設也沒有量化。vLLM 部署配方把 BF16 至少 600 GB、NVFP4 至少 180 GB aggregate GPU memory 當作 baseline;這是載入與 serving 的基準容量,不保證在既定併發下跑滿 1M context。因此它是「每個 token 啟用較少參數」,不是「一張消費級顯卡就能跑的 12B 模型」。

授權同樣不能只看一個標籤。Hugging Face metadata 寫的是 Apache-2.0,同一模型卡也連到 Thinking Machines 的 Model Acceptable Use Policy;該 AUP 明列,存取、下載或使用 Model Materials 及其修改版本即受其條件約束。較準確的描述是:這是一個帶有 Apache-2.0 metadata、同時附有額外 Model AUP 的 open-weights checkpoint,不是無限制使用的同義詞。

With these improvements, Inkling-Small surpassed Inkling on reasoning and agentic coding benchmarks. Inkling maintains an advantage on knowledge coverage and factuality.

中文:經過這些改進,Inkling-Small 在推理與代理式程式設計評測上超越 Inkling;但 Inkling 在知識覆蓋與事實正確性上仍占優勢。

Thinking Machines,〈Introducing Inkling-Small〉,2026 年 7 月 30 日

它變強的原因,不只是把模型縮小

若只看 276B 對 975B,很容易把這場比較想成一個乾淨的「同一配方、只改尺寸」實驗;官方披露的訓練過程恰好否定了這種讀法。Inkling-Small 比大型版更晚開始訓練,因此採用了更新的 pre-training data mix 與 machine-learning recipe。preview checkpoint 的 post-training 又部分使用 Inkling 當 teacher 做 on-policy distillation,之後還多跑了兩週 agentic coding RL。

換句話說,Small 的成績同時混合了三個變因:較少 active parameters、較新的訓練配方,以及來自大型模型的蒸餾訊號。這正是本次發布最值得注意的地方——它顯示訓練效率正在進步;但也代表我們不能把所有差距都歸功於 MoE 尺寸,更不能推論「任何模型砍到三成都不會變弱」。這與近期 Kimi K3 權重落地DeepSeek V4 Flash 帶出的訊號一致:競爭焦點正從單純堆參數,移到資料、post-training、推理配方與可部署性如何一起設計。

「四分之一算力」是最需要降溫的說法

官方英文說的是「a quarter of its size」,不是經完整系統量測後得到「端到端算力恰好只需 25%」。用公告數字直接相除,12B/41B active 是 29.3%,276B/975B total 是 28.3%,比較接近大型版的三成。這仍是很大的縮減,只是不能順手翻成「省 75% 算力」或「快四倍」。

官方三面板曲線比較 Inkling-Small 與 Inkling 在 Terminal-Bench、Humanity's Last Exam 與 IFBench 的輸出 TFLOPs
官方 effort sweep 圖:紫線為 Inkling-Small、藍線為 Inkling。橫軸是估算的 output TFLOPs/task,不是完整端到端運算成本。

圖中的 output TFLOPs,是用「2 × active parameters × 每題平均生成 tokens」估算。這個代理值適合比較輸出階段的規模與 reasoning length,卻沒有完整納入 prompt prefill、長 context 下的 global/local attention、SWA/sconv state 與 KV cache、expert-routing overhead、跨卡通訊、記憶體頻寬及硬體利用率。若你的產品在意的是每秒完成多少任務、P95 latency 或每位使用者成本,仍要回到實際 serving stack 測量;可參考我們對 LLM inference engine 的拆解,理解「參數較少」為何不會自動變成「服務便宜同樣比例」。

Benchmark 的答案:同梯隊,不是全面取代

這批數字不是全都出自同一種來源。官方公告明列:適用時採用 Artificial AnalysisScale AI MCP AtlasARC Prize 的外部結果;SWE-bench Verified 與「best harness」Terminal-Bench 等部分 coding 數字,則來自 Thinking Machines 自己的 harness。官方列出的 external-provider mapping 沒有包含 SimpleQA Verified、Global-MMLU-Lite 等項目,本文因此把它們視為公司發布表的自報結果。把這些數字混成一句「獨立 benchmark 已全面證實」會過度延伸。

評測Inkling-SmallInkling能得出的結論
AA Intelligence Index v4.140.1740.74大型版高約 0.57;整體應視為同梯隊
HLE text-only(2,158 題、單次)31.6%29.7%Small 在此推理測試領先
GPQA Diamond(198 題 × 5)89.5%87.2%Small 領先,但差距不大
SciCode(288 subproblems × 3)48.7%46.1%Small 領先
GDPval-AA v2(220 tasks、Elo)1,2691,238Small 在 agentic real-world/經濟價值工作任務領先;數字不是百分比
MCP Atlas all(1,000 tasks:500 public+500 held out)79.2% ± 2.576.0% ± 2.6點估計 Small 較高,但信賴區間重疊
ARC-AGI-1/2(verified single run,含半私有驗證集)84.0%/40.1%79.5%/36.5%Small 在兩組 verified run 領先
Terminal-Bench 2.1(AA standardized)55.06%55.06%標準化外部結果完全打平
Terminal-Bench 2.1(TML best harness)64.7%63.8%內部最佳 harness 僅領先 0.9;高度依賴 agent scaffold
Tau3 Banking15.5%23.7%大型版明顯領先的反例
SimpleQA Verified(TML 自報)20.6%43.9%公司發布表顯示大型版知識/事實正確性優勢很大
數字以 2026 年 8 月 2 日可查結果為準;不同評測的題數、重複次數與 harness 不同,不能直接把分數相加。

最誠實的總結是:Small 在 HLE、GPQA、SciCode、GDPval、ARC-AGI 等多個特定評測領先,也在 MCP Atlas 與大型版接近;但 Artificial Analysis 的整體 Intelligence Index 仍是 40.17 對 40.74,Agentic Index 則是 30.78 對 32.34,由大型版略高。這支持「追到同一梯隊」,不支持「全面超越」。

知識面的代價也很清楚:公司發布表中的 SimpleQA 是 20.6% 對 43.9%、Global-MMLU-Lite 是 86.7% 對 88.7%;外部 AA Omniscience Index 則是 -8.97 對 2.05,都由大型 Inkling 領先。這與官方自己承認的 knowledge coverage/factuality 差距一致。不過「事實性」不是單一維度,不能把三項結果外推成 Small 在任何情境都更會 hallucinate;產品仍應依自己的資料分布建 eval,而不是拿一個總榜代替驗收。這也是 AI 模型路由與評測真正要解的問題。

AlphaLab 的判讀:突破是真的,「Small」也容易誤導

我同意:訓練效率進步,比榜單第一更重要

在 active parameters 約三成的條件下,Small 能在多項推理與工具任務進入大型版同一梯隊,說明後起模型可以靠更好的 data mix、distillation 與 RL,把每次啟用的參數用得更有效率。這為部分 workload 降低輸出階段成本創造了空間,也讓「大模型當老師、小模型做大量服務」的路線更可信;真正的服務成本仍要納入輸入長度、硬體利用率、跨卡通訊與併發。

我保留:這不是受控縮放實驗,agent 成績尤其吃 harness

Small 比大型版晚訓練、換過資料與 recipe、接受大型版蒸餾、又多做兩週 coding RL;因此結果證明的是「新系統整體更有效率」,不是單獨證明「參數縮小造成進步」。Terminal-Bench 的外部 standardized 結果雙方都是 55.06%,到了公司 best harness 才變成 64.7% 對 63.8%,更提醒我們:agent 能力屬於模型、prompt、工具介面與 scaffold 的乘積,單看模型名稱不夠。

我更看重:可下載 checkpoint 讓外界有機會驗證

一個公司公布的分數,只能建立暫時信心;完整 checkpoint 才讓第三方有機會重跑 benchmark、檢查 failure modes、測量真實吞吐、做領域微調。這是 Inkling-Small 完整權重比單一排行榜名次更有公共價值的地方。截至 2026 年 8 月 2 日,本次公告列出的交付物是權重、Tinker 微調與 Playground,沒有宣稱提供一套可完整重現訓練的資料與流程;它把可驗證邊界向外推了一步,但不是「training release 已完整開源」的同義詞。關於 open/closed 模型的真正分界,可接著讀 開放與封閉 AI 市場的分析。

你現在可以怎麼用這個發布?

  • 做應用:先在 Tinker 或可用端點,以自己的真實任務建立固定題組;同時 sweep reasoning effort,記錄正確率、輸出 tokens、延遲與失敗類型。不要直接用 xhigh 當預設。
  • 做基礎設施:以 vLLM 配方的 BF16 至少 600 GB aggregate VRAM baseline 起算,再為實際 context 長度、併發、KV cache、expert parallel 與跨卡通訊留容量,並另測量化後品質。這個 baseline 不是跑滿 1M context 的保證;12B active 也不是 12B memory footprint。
  • 做研究或採購:先重跑 HLE 與 MCP Atlas public 500;ARC-AGI 先跑 public set,若要對照 verified 分數,再申請 ARC Prize 的半私有集驗證。對公司自報的 coding/factuality 結果,要求逐題軌跡、重複次數與 scaffold 設定,再決定是否進入 production。

如果你的 workload 主要是 reasoning、coding 與工具呼叫,Inkling-Small 值得進入候選清單;若依賴長尾知識與封閉書本事實,SimpleQA 與 Omniscience 的落差則是必測風險。最好的決策不是問「Small 有沒有贏」,而是問「它在我的固定成本與錯誤容忍度下,能不能比現有路由更有效」。

延伸閱讀

Inkling-Small 最值得記住的,不是「276B 打敗 975B」這句容易傳播的標題,而是模型競爭的單位正在改變:參數規模、訓練 recipe、teacher signal、agent harness、部署記憶體與授權條件,必須放在同一張成本表上比較。完整權重讓這場比較終於可以從公告走向實驗;接下來要看的,是第三方能否在真實工作流重現這個效率故事。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。