2026 年 7 月 30 日,Thinking Machines 在官方公告〈Introducing Inkling-Small〉釋出 Inkling-Small 完整權重:官方把它標成 276B 總參數、每個 token 啟用 12B 參數的多模態 MoE,最高 context 設定為 1M tokens,並能以同一模型接收文字、圖片與音訊。最吸睛的不是「Small」這個名字,而是一個更難回答的問題:它真的用小得多的 active 規模,追上 975B/41B active 的大型 Inkling 了嗎?
先把日期釐清。7 月 15 日的 Inkling 公告只預告 Inkling-Small preview;本輪的新事件,是 7 月 30 日釋出的 full weights。關注度確實不低:截至 2026 年 8 月 2 日擷取,官方 X 貼文約有 140.3 萬次觀看、3,212 個 likes;Hugging Face 模型頁則顯示 209 個 likes、過去一個月 3,998 次 downloads。這些是會變動的平台計數,只能說明市場正在看,不能證明模型已被 4,000 個團隊完整部署。

Inkling-Small 完整權重,究竟交出了什麼?
這不是只多一個雲端 API 名稱。官方同時提供可下載 checkpoint、Tinker 微調入口,以及 Tinker Playground 的文字/圖片/音訊對話。模型輸入可跨三種模態,但輸出仍是文字;「多模態」不等於它會生成圖片或聲音。
| 項目 | 已公開規格 | 讀法與限制 |
|---|---|---|
| 架構 | 42 層 decoder;權重索引顯示 40 層採 MoE FFN、2 層採 dense FFN。每個 MoE 層由 256 個 routed experts 選 6 個,另啟用 2 個 shared experts | 12B active 描述每次推理啟用的參數,不是下載大小 |
| 參數 | 官方標示 276B total/12B active | HF Hub 的 safetensors metadata 對目前 checkpoint 計數為 265,956,439,090 個 tensor elements,頁面四捨五入顯示 266B;截至 2026 年 8 月 2 日,官方公告與模型卡未說明兩種計數口徑的差異 |
| Context | 設定上限 1,048,576 tokens | 上限設定不等於每個服務端點都會開滿,也不證明模型在整段 1M context 都能維持相同品質 |
| 多模態 | 文字、圖片、音訊輸入;文字輸出 | 圖片以 40×40 patches 處理;音訊由 dMel spectrogram 表示 |
| Reasoning effort | 模型以 [0,1) 的連續 scalar conditioning;Tinker presets 為 none/minimal/low/medium/high/xhigh,HF chat template 把最高檔命名為 max=0.99 | 實際參數名稱依 serving stack;提高 effort 也不保證每一道題都必然更準 |

「完整權重」也要精確理解。Hugging Face 上的 BF16 主權重加上 MTP 權重,合計約 531.9 GB(約 495.4 GiB);另一路 NVFP4 mixed-precision checkpoint 約 170.7 GB(約 159.0 GiB),其 quant config 排除了部分 attention、多模態與 routing 模組,KV cache 預設也沒有量化。vLLM 部署配方把 BF16 至少 600 GB、NVFP4 至少 180 GB aggregate GPU memory 當作 baseline;這是載入與 serving 的基準容量,不保證在既定併發下跑滿 1M context。因此它是「每個 token 啟用較少參數」,不是「一張消費級顯卡就能跑的 12B 模型」。
授權同樣不能只看一個標籤。Hugging Face metadata 寫的是 Apache-2.0,同一模型卡也連到 Thinking Machines 的 Model Acceptable Use Policy;該 AUP 明列,存取、下載或使用 Model Materials 及其修改版本即受其條件約束。較準確的描述是:這是一個帶有 Apache-2.0 metadata、同時附有額外 Model AUP 的 open-weights checkpoint,不是無限制使用的同義詞。
With these improvements, Inkling-Small surpassed Inkling on reasoning and agentic coding benchmarks. Inkling maintains an advantage on knowledge coverage and factuality.
中文:經過這些改進,Inkling-Small 在推理與代理式程式設計評測上超越 Inkling;但 Inkling 在知識覆蓋與事實正確性上仍占優勢。
Thinking Machines,〈Introducing Inkling-Small〉,2026 年 7 月 30 日
它變強的原因,不只是把模型縮小
若只看 276B 對 975B,很容易把這場比較想成一個乾淨的「同一配方、只改尺寸」實驗;官方披露的訓練過程恰好否定了這種讀法。Inkling-Small 比大型版更晚開始訓練,因此採用了更新的 pre-training data mix 與 machine-learning recipe。preview checkpoint 的 post-training 又部分使用 Inkling 當 teacher 做 on-policy distillation,之後還多跑了兩週 agentic coding RL。
換句話說,Small 的成績同時混合了三個變因:較少 active parameters、較新的訓練配方,以及來自大型模型的蒸餾訊號。這正是本次發布最值得注意的地方——它顯示訓練效率正在進步;但也代表我們不能把所有差距都歸功於 MoE 尺寸,更不能推論「任何模型砍到三成都不會變弱」。這與近期 Kimi K3 權重落地、DeepSeek V4 Flash 帶出的訊號一致:競爭焦點正從單純堆參數,移到資料、post-training、推理配方與可部署性如何一起設計。
「四分之一算力」是最需要降溫的說法
官方英文說的是「a quarter of its size」,不是經完整系統量測後得到「端到端算力恰好只需 25%」。用公告數字直接相除,12B/41B active 是 29.3%,276B/975B total 是 28.3%,比較接近大型版的三成。這仍是很大的縮減,只是不能順手翻成「省 75% 算力」或「快四倍」。

圖中的 output TFLOPs,是用「2 × active parameters × 每題平均生成 tokens」估算。這個代理值適合比較輸出階段的規模與 reasoning length,卻沒有完整納入 prompt prefill、長 context 下的 global/local attention、SWA/sconv state 與 KV cache、expert-routing overhead、跨卡通訊、記憶體頻寬及硬體利用率。若你的產品在意的是每秒完成多少任務、P95 latency 或每位使用者成本,仍要回到實際 serving stack 測量;可參考我們對 LLM inference engine 的拆解,理解「參數較少」為何不會自動變成「服務便宜同樣比例」。
Benchmark 的答案:同梯隊,不是全面取代
這批數字不是全都出自同一種來源。官方公告明列:適用時採用 Artificial Analysis、Scale AI MCP Atlas 與 ARC Prize 的外部結果;SWE-bench Verified 與「best harness」Terminal-Bench 等部分 coding 數字,則來自 Thinking Machines 自己的 harness。官方列出的 external-provider mapping 沒有包含 SimpleQA Verified、Global-MMLU-Lite 等項目,本文因此把它們視為公司發布表的自報結果。把這些數字混成一句「獨立 benchmark 已全面證實」會過度延伸。
| 評測 | Inkling-Small | Inkling | 能得出的結論 |
|---|---|---|---|
| AA Intelligence Index v4.1 | 40.17 | 40.74 | 大型版高約 0.57;整體應視為同梯隊 |
| HLE text-only(2,158 題、單次) | 31.6% | 29.7% | Small 在此推理測試領先 |
| GPQA Diamond(198 題 × 5) | 89.5% | 87.2% | Small 領先,但差距不大 |
| SciCode(288 subproblems × 3) | 48.7% | 46.1% | Small 領先 |
| GDPval-AA v2(220 tasks、Elo) | 1,269 | 1,238 | Small 在 agentic real-world/經濟價值工作任務領先;數字不是百分比 |
| MCP Atlas all(1,000 tasks:500 public+500 held out) | 79.2% ± 2.5 | 76.0% ± 2.6 | 點估計 Small 較高,但信賴區間重疊 |
| ARC-AGI-1/2(verified single run,含半私有驗證集) | 84.0%/40.1% | 79.5%/36.5% | Small 在兩組 verified run 領先 |
| Terminal-Bench 2.1(AA standardized) | 55.06% | 55.06% | 標準化外部結果完全打平 |
| Terminal-Bench 2.1(TML best harness) | 64.7% | 63.8% | 內部最佳 harness 僅領先 0.9;高度依賴 agent scaffold |
| Tau3 Banking | 15.5% | 23.7% | 大型版明顯領先的反例 |
| SimpleQA Verified(TML 自報) | 20.6% | 43.9% | 公司發布表顯示大型版知識/事實正確性優勢很大 |
最誠實的總結是:Small 在 HLE、GPQA、SciCode、GDPval、ARC-AGI 等多個特定評測領先,也在 MCP Atlas 與大型版接近;但 Artificial Analysis 的整體 Intelligence Index 仍是 40.17 對 40.74,Agentic Index 則是 30.78 對 32.34,由大型版略高。這支持「追到同一梯隊」,不支持「全面超越」。
知識面的代價也很清楚:公司發布表中的 SimpleQA 是 20.6% 對 43.9%、Global-MMLU-Lite 是 86.7% 對 88.7%;外部 AA Omniscience Index 則是 -8.97 對 2.05,都由大型 Inkling 領先。這與官方自己承認的 knowledge coverage/factuality 差距一致。不過「事實性」不是單一維度,不能把三項結果外推成 Small 在任何情境都更會 hallucinate;產品仍應依自己的資料分布建 eval,而不是拿一個總榜代替驗收。這也是 AI 模型路由與評測真正要解的問題。
AlphaLab 的判讀:突破是真的,「Small」也容易誤導
我同意:訓練效率進步,比榜單第一更重要
在 active parameters 約三成的條件下,Small 能在多項推理與工具任務進入大型版同一梯隊,說明後起模型可以靠更好的 data mix、distillation 與 RL,把每次啟用的參數用得更有效率。這為部分 workload 降低輸出階段成本創造了空間,也讓「大模型當老師、小模型做大量服務」的路線更可信;真正的服務成本仍要納入輸入長度、硬體利用率、跨卡通訊與併發。
我保留:這不是受控縮放實驗,agent 成績尤其吃 harness
Small 比大型版晚訓練、換過資料與 recipe、接受大型版蒸餾、又多做兩週 coding RL;因此結果證明的是「新系統整體更有效率」,不是單獨證明「參數縮小造成進步」。Terminal-Bench 的外部 standardized 結果雙方都是 55.06%,到了公司 best harness 才變成 64.7% 對 63.8%,更提醒我們:agent 能力屬於模型、prompt、工具介面與 scaffold 的乘積,單看模型名稱不夠。
我更看重:可下載 checkpoint 讓外界有機會驗證
一個公司公布的分數,只能建立暫時信心;完整 checkpoint 才讓第三方有機會重跑 benchmark、檢查 failure modes、測量真實吞吐、做領域微調。這是 Inkling-Small 完整權重比單一排行榜名次更有公共價值的地方。截至 2026 年 8 月 2 日,本次公告列出的交付物是權重、Tinker 微調與 Playground,沒有宣稱提供一套可完整重現訓練的資料與流程;它把可驗證邊界向外推了一步,但不是「training release 已完整開源」的同義詞。關於 open/closed 模型的真正分界,可接著讀 開放與封閉 AI 市場的分析。
你現在可以怎麼用這個發布?
- 做應用:先在 Tinker 或可用端點,以自己的真實任務建立固定題組;同時 sweep reasoning effort,記錄正確率、輸出 tokens、延遲與失敗類型。不要直接用 xhigh 當預設。
- 做基礎設施:以 vLLM 配方的 BF16 至少 600 GB aggregate VRAM baseline 起算,再為實際 context 長度、併發、KV cache、expert parallel 與跨卡通訊留容量,並另測量化後品質。這個 baseline 不是跑滿 1M context 的保證;12B active 也不是 12B memory footprint。
- 做研究或採購:先重跑 HLE 與 MCP Atlas public 500;ARC-AGI 先跑 public set,若要對照 verified 分數,再申請 ARC Prize 的半私有集驗證。對公司自報的 coding/factuality 結果,要求逐題軌跡、重複次數與 scaffold 設定,再決定是否進入 production。
如果你的 workload 主要是 reasoning、coding 與工具呼叫,Inkling-Small 值得進入候選清單;若依賴長尾知識與封閉書本事實,SimpleQA 與 Omniscience 的落差則是必測風險。最好的決策不是問「Small 有沒有贏」,而是問「它在我的固定成本與錯誤容忍度下,能不能比現有路由更有效」。
延伸閱讀
- Kimi K3 權重正式落地:開放權重模型真正該看什麼
- DeepSeek V4 Flash:速度、成本與 benchmark 的邊界
- LLM inference engine:模型參數如何變成真實延遲與成本
- AI 模型路由與評測:別讓單一總榜替產品做決策
- Open vs. Closed AI:權重公開後,哪些東西仍然沒有公開
Inkling-Small 最值得記住的,不是「276B 打敗 975B」這句容易傳播的標題,而是模型競爭的單位正在改變:參數規模、訓練 recipe、teacher signal、agent harness、部署記憶體與授權條件,必須放在同一張成本表上比較。完整權重讓這場比較終於可以從公告走向實驗;接下來要看的,是第三方能否在真實工作流重現這個效率故事。
