OpenBMB 在 2026 年 9 月 7 日更新並釋出 MiniCPM5-2B:一款採標準 Llama 架構、總參數約 25.17 億、權重以 Apache-2.0 授權的 dense 文字模型。它把本機助理、Coding Agent、工具呼叫與長文推理放進同一個 2B 級模型,設定檔也給出 131,072 tokens 的最大 context;這些條件讓 MiniCPM5-2B 看起來很像「小到能在本機跑、強到能替你做事」的交會點。
最吸睛的證據來自 Artificial Analysis(AA):在 9 月 7 日發布時採用的 Intelligence Index v4.2 中,它以四捨五入後的 15 分,成為 AA 當時完成量測的 open-weight、4B 以下模型首位。但同一天 v4.3 上線後,模型頁改列約 14 分,而且標明是估算、完整獨立評測尚待完成。換句話說,真正值得分析的不是「2B 打贏一切」,而是:一款這麼小的模型,為何能在部分 Agent 類任務突圍?這個領先又能外推到多少真實工作?

以下先還原 OpenBMB 這次真正開放了什麼,再拆解 AA 的獨立成績與版本差異,最後從記憶體、長 context 和 Agent 可靠度判斷它適合誰。結論先說:MiniCPM5-2B 是一個很有價值的低成本實驗底座;但截至 2026 年 9 月 8 日,本文查閱的 OpenBMB model card、量化 repositories 與 AA 頁面沒有提供指定手機的速度、峰值 RAM、功耗與溫度數據,因此不能把它寫成已驗證的手機 Agent,也不能用一個綜合分數取代自己的任務測試。
MiniCPM5-2B 不是「剛好 20 億參數」
OpenBMB 對產品定位寫得很直接:
“It is designed for local assistants, coding agents, tool-use workflows, and reasoning scenarios where a compact model is preferred.”
中文:「它是為本機助理、Coding Agent、工具使用流程,以及偏好小型模型的推理情境而設計。」
OpenBMB, MiniCPM5-2B model card
但「2B」是級距名稱,不是精確參數量。官方 model card 與 config 顯示,模型共有 2,516,756,480 個參數;若不計 embedding,則是 1,981,982,720。這也解釋了為何模型名稱寫 2B,Hugging Face 介面卻把總量四捨五入顯示為 3B。它使用標準 LlamaForCausalLM、42 層 Transformer、16 個 query heads 與 2 個 KV heads,最大位置長度設定為 131,072。想理解這些結構如何影響推論,可以先看 AlphaLab 的大型語言模型運作原理。
| 官方可驗證項目 | MiniCPM5-2B 的內容 | 不能直接推出的結論 |
|---|---|---|
| 模型規模 | 約 25.17 億總參數;約 19.82 億非 embedding 參數 | 「2B」不等於精確 20 億,也不代表所有 2B 模型成本相同 |
| 架構 | 標準 Llama Causal LM、42 層、GQA 16Q/2KV | 相容主流 runtime,不等於每個後端都已得到同樣速度與輸出 |
| Context 設定 | 131,072 tokens | 這是設定上限,不是手機已實測可順跑 128K |
| 權重授權 | Apache-2.0 | 開放權重不等於整個訓練流程與所有上游資料都能一鍵重現 |
| 本機格式 | 官方提供 GGUF、MLX 4-bit、GPTQ-origin 4-bit,並列出 llama.cpp、Ollama、LM Studio 等用法 | 有檔案與 recipe,不等於已有跨裝置的獨立效能驗證 |
「標準 Llama 架構」的實際好處,是社群不用等待一套全新的模型 loader;而 GGUF、MLX 等量化版本,讓測試門檻下降。官方名為 GPTQ 的 4-bit repository,其 metadata 顯示是把 GPTQ-origin 權重重排成 AWQ GEMM layout,不能把它讀成另外做過一次 AWQ scale search。官方 Transformers 範例預設啟用 thinking,目前的 chat template也提供 enable_thinking=false 分支;工具呼叫仍要配對相容的 template 與 parser。不同推論後端的適用情境,可搭配vLLM、llama.cpp 與 MLX 推論引擎比較一起判讀。這些是部署便利性的證據,卻還不是終端裝置效能的證據。
真正的產品是訓練配方:三類 RL 教師,再用 OPD 收斂回小模型

OpenBMB 的訓練圖透露了 MiniCPM5-2B 的核心思路:先做 base 與 mid-training,再進入 SFT;接著分別用 reasoning、general task、agentic 三類 RL 專家產生能力,最後以 On-Policy Distillation(OPD)把教師回饋蒸餾回同一個小型 student。官方稱共有 16 個 RL expert models,其中 5 個聚焦 Agent 任務。這和模型蒸餾的基本邏輯一致:小模型不是只靠縮小,而是把較強教師在特定分布上的行為壓進有限容量。
更具體地說,OpenBMB 描述的 OPD 會重用 RL teachers 的 prompts,並在 student 自己生成回應時,逐位置計算 student 與 teacher 全詞彙 logits 的 reverse KL,作為 token-level 的學習訊號。相較 SFT baseline,官方圖表自報 reasoning/general 平均增加 10.96 分、agentic 平均增加 6.96 分;這是 OpenBMB 的內部比較,不是獨立 ablation,價值在於交代機制與待重現假設,而不是直接證明因果幅度。
圖左側的 Long Decay 寫著 32K → 128K → 512K,描述的是官方訓練階段標籤;真正釋出的 config.json 仍是 131,072 最大位置長度,不能把圖中的 512K 當成 release context。官方同時把 deep-thinking SFT 標成 400B tokens;截至 2026 年 9 月 8 日,本文查閱的 model card 提供流程與總量,未逐項對帳樣本混合、epochs 與 token accounting,因此本文只把它當發布方揭露的配方規模,不據此推算訓練成本。
這次也不只有權重。OpenBMB 列出 UltraData-SFT-Agent-2609(483,661 條 trajectories,發布時可約稱 50 萬)、UltraData-RL-2609(85,995 筆 prompts,涵蓋數學、程式、長文與知識),以及程式資料集 UltraData-Code。官方資料清單也連到較早發布的 UltraX Preview 等語料;因此這是與模型配方關聯的公開資料家族,不是所有資料都在 9 月 7 日同時首次上線。它比只丟權重更利於研究者檢視資料設計與做後續實驗。
不過,這裡要把「公開」拆成三層:權重有 Apache-2.0;OpenBMB 自製資料集有自己的授權聲明;部分資料仍承接上游來源的 MIT、CC BY、CC BY-SA 或其他條件。SFT-Agent 的「約 50 萬 samples」也是 dataset card 的發布方說法,不能把網頁 viewer 當下顯示的列數直接等同完整 sample 數。這正是開放權重、資料與完整可重現性之間的差別:MiniCPM5-2B 比純權重發布多走了幾步;截至 2026 年 9 月 8 日,本文查閱的 OpenBMB model/dataset cards 與 AA 報告未提供外部端到端訓練重現結果。
15 分如何來的?先把 Artificial Analysis 的版本鎖住
Artificial Analysis 在 2026 年 9 月 7 日發布的獨立評測,用 Intelligence Index v4.2 得到四捨五入後的 15 分。依該篇當時的比較集合,MiniCPM5-2B 是完成量測的 open-weight、4B 以下模型首位;下一個 4B 以下、已量測的 Granite 4.2 3B 為 11 分。這是一個有意義的相對結果,但它的完整句子必須保留「AA、v4.2、發布當時、該資料庫」四個範圍。

同一天,AA 推出 Intelligence Index v4.3,用 AutomationBench-AA 取代 τ³ Banking、以 Terminal-Bench v4.0 取代 v2.1,兩組替換合計占指數 15%,private tests 比重也由 40% 提高至 45%。目前的 MiniCPM5-2B 模型頁顯示約 14.3、四捨五入為 14,仍列 Tiny(≤4B)級距前段,但頁面清楚標記為 estimated,完整獨立 evaluation forthcoming。
所以 15 變 14 不是模型一夜退步,而是考卷和權重改了;更不能把暫估的 v4.3 分數說成已完成的新一輪獨立實測。這也是閱讀任何AI Evals時最重要的紀律:先問版本、題組、harness、重複次數和評分器,再看排名。
相對排名很亮眼,絕對通過率仍提醒你別放掉驗收
| AA v4.2 發布快照 | MiniCPM5-2B | 正確讀法 |
|---|---|---|
| Intelligence Index | 15(四捨五入) | 多項測試加權後、在該版資料庫中的相對指標 |
| GDPval-AA v2 | 發布時 Elo 831;目前頁面約 829、95% CI ±22 | Elo 不是 83.1% 正確率;人類專家錨點為 1000,且結果受工具與評審 panel 影響 |
| Humanity’s Last Exam | 8.94% | AA 使用 2,158 題 text-only 子集、單次作答;不代表一般知識有 91% 都答錯 |
| Terminal-Bench | v2.1 為 8.61% | 量的是模型、Terminus harness 與 sandbox 的組合;不能當一般 coding accuracy |
| CritPt | 原始約 0.286%,介面四捨五入為 0% | 極難科學推理題仍幾乎沒有通過;「0%」也不等於字面上一次都沒成功 |
這組數字看似矛盾,其實回答不同問題。15 分說的是:在 AA v4.2 的加權框架裡,MiniCPM5-2B 相對其他同級小模型表現出色;HLE、Terminal-Bench v2.1 和 CritPt 則告訴你,遇到高難度知識、真實終端操作與研究級物理推理時,它的絕對成功率仍低。GDPval 的 831 也是相對 Elo,不是完成 83.1% 工作;AA 只使用 GDPval 的 220 題 public-gold 子集,每題一次 run,並由三個前沿 LLM 組成的 panel 做盲式配對判斷。
更重要的是,OpenBMB model card 的多數比較表分數是團隊內部重現,只有標上符號的一部分來自 AA。像官方平均 53.9、SWE-bench Verified 46.4 或 LiveCodeBench 69.1,都應該寫成實驗室自報,不能併入「獨立驗證」。AA 本身雖獨立於 OpenBMB,仍有自家 harness、LLM judges 與 45% private tests;它提供外部壓力測試,並不是不可質疑的真理機器。
1.56GB 的 Q4 權重,為什麼不等於 1.56GB 就能跑 128K?
官方 GGUF repository列出的檔案大小很有吸引力:Q4_K_M 約 1.56GB、Q8_0 約 2.68GB、F16 約 5.04GB。可是那只是權重檔;執行時還要加上 runtime、運算 buffer、context 和 KV cache。把下載大小直接寫成裝置所需記憶體,是常見的單位錯誤之一。
依官方 config 做一個透明的理論估算:若 42 層、2 個 KV heads、每個 head dimension 128,完整保存 131,072 tokens 的 K 與 V,且 KV cache 採 BF16(每元素 2 bytes),光 KV cache 約是 5.25GiB。這還沒算 1.56GB 的 Q4 權重與其他 overhead;若 backend 使用量化 KV、滑動視窗或其他記憶體策略,數字才可能下降。公式是設定值推導,不是 AlphaLab 的裝置實測。
因此,本篇只把 1.56GB Q4 檔案與主流 runtime recipe 視為「具備本機部署條件」的證據,不把它們當成手機速度、功耗或溫度的實測結果。128K context 是否能在你的手機或筆電上實用,仍要用指定裝置、backend 與 KV cache 格式驗證。選模型前可先用本機 LLM 顯存與 Context 決策樹估算整體占用。
AlphaLab 的判讀:它的價值不只在「小」,而是讓失敗變便宜
我同意的:這是一個同時提供多種權重格式與部分訓練資料的 2B 級實驗底座
MiniCPM5-2B 把幾個原本分散的優點疊在一起:標準架構降低 runtime 整合成本;Apache-2.0 權重降低再利用摩擦;GGUF、MLX、GPTQ 讓不同硬體更容易起跑;OpenBMB 還同步揭露部分 code、Agent SFT 與 RL 資料。AA v4.2 的相對領先則提供一個獨立訊號,說明它不只是「能載入」,在若干工具與工作型任務上也確實有競爭力。
小模型的潛在戰略價值,往往不是每題都最聰明,而是較低的運算門檻、資料可留在本機,並且可以反覆重跑。當任務有清楚的工具、有限的操作範圍和可機械驗收的結果時,你可以用重試、搜尋、規則與較強模型升級路徑彌補單次推理不足。模型變小,讓你更便宜地發現錯誤、收集失敗案例,再決定哪些任務值得交給更大的模型。
我存疑的:排行榜、長 context 與 Agent-ready 被包成了同一句話
AA v4.2 第一名只代表 2026 年 9 月 7 日當時 AA 已完成 v4.2 量測的模型集合;AA 以一致條件比較納入的模型,但不涵蓋未測模型,也不能外推到你的語言、量化版本與工具鏈。v4.3 在同日換題,分數隨即改變,正好證明 composite score 是評測設計的函數。再加上 HLE 8.94%、Terminal-Bench v2.1 8.61% 與 CritPt 約 0.286%,現階段更適合說它「值得試」,不適合說它「可以無人監督」。
同樣地,131,072 context 是 config 能接受的上限,不保證每個位置都有同樣品質,也不保證終端裝置放得下 KV cache。真正的 Agent-ready 必須同時驗證 tool-call 格式、任務完成率、錯誤恢復、惡意輸入、超時與權限邊界;一張模型卡或一個排行榜都沒有替你完成這些工作。
OpenBMB 自己也在 model card 的 limitations 提醒:模型可能產生不準確、有偏見或冒犯性的內容,也可能受 jailbreak 影響;政治、醫療、金融與法律輸出並未經專家審查。這不是通用免責語,而是使用範圍的實質邊界:工具權限愈高,外部驗收與可逆操作就愈重要。
如果你想用 MiniCPM5-2B,先做這四個實驗
- 從 8K 與 Q4 開始:先量冷啟動、首 token、tokens/s、峰值 RAM 與溫度,再逐步把 context 拉長;不要一開始就用 128K 當成功條件。
- 固定 runtime 與 chat template:把模型 revision、量化檔、llama.cpp/MLX 版本、system prompt、tool parser 和 sampling 參數一起記錄,否則兩次結果無法比較。
- 建立 30–100 個真實任務 eval:將工具呼叫格式、最終結果、超時、無效重試和人工接手分開計分;不要只看「回答看起來合理」。
- 設計升級與拒絕路徑:低風險、可驗收工作留給 MiniCPM5-2B;高權限、不可逆或模糊任務,在信心不足時轉給較強模型或人類。
如果它在你的固定測試集過關,那麼 2B 級模型的低成本就會變成真實產品優勢;如果沒有過關,你也能精確知道問題出在模型、量化、context、prompt 還是工具層,而不是用排行榜替失敗找理由。
接著閱讀
左右滑動查看更多推薦
MiniCPM5-2B 最值得追的下一個里程碑,不是再多一個「同級第一」標題,而是用同一量化版本、公開 harness 與固定任務,在不同裝置或實驗室重複 AA 已提供的外部訊號。現有證據已足以把它列入嚴格測試;把它當成低門檻、開放權重的 Agent 元件,會比直接當成縮小版前沿模型更接近現實。






