2026 年 9 月 22 日,小米 MiMo 團隊在官方文件站發布〈MiMo-V2.6: Scaling Up Reinforcement Learning for Self-Improvement〉,同步釋出 MiMo-V2.6 Pro 與 Flash 的公開權重、技術報告,以及可處理文字、圖片、影片與音訊輸入的 1M-token 模型規格。
這次發布最值得注意的,不是小米又把參數做大,而是它把一場高算力、混合任務的 agentic RL 後訓練攤在公開儀表板上:兩個模型各跑 30 個更新步驟,並揭露成本、失敗、重啟與評測曲線。我的結論先放前面:這是大規模 RL 工程與開放權重生態的一次重要進展,也有 Artificial Analysis 的外部測量支持模型本身很強;但它還沒有證明 1M 長度下的可靠推理、完整可重現的開源訓練,或模型已達成遞迴式自我改進。
以下會先忠實還原 MiMo-V2.6 做了什麼,再把「六天、75 萬條 trajectory、1M context、MIT、46 分」逐一放回正確範圍,最後說明為什麼這條路值得追蹤,卻還不能直接叫作 RSI。

MiMo-V2.6 發布了什麼?先把規格讀對
Pro 與 Flash 都是稀疏 Mixture-of-Experts(MoE)模型。依官方Pro model card與Flash model card,Pro 有 1.02T 總參數、每個 token 啟用 42B;Flash 有 309B 總參數、啟用 15B。這裡的「啟用」描述每個 token 在一次 forward pass 動用的參數規模,不代表只需儲存 42B 或 15B 權重。
| 官方規格 | MiMo-V2.6-Pro | MiMo-V2.6-Flash | 該怎麼讀 |
|---|---|---|---|
| 總參數/啟用參數 | 1.02T/42B | 309B/15B | 稀疏路由降低每 token 計算量,不會讓完整權重縮成同等大小的 dense 模型 |
| context window | 1M token | 1M token | 是可接受的長度上限,不等於每個位置都有相同推理品質 |
| 輸入模態 | 文字、圖片、影片、音訊 | 文字、圖片、影片、音訊 | 技術報告描述的模型頭產生文字;媒體成品 demo 另會調用工具 |
| 官方部署範例 | TP16/EP16、兩個節點 | TP8 | 啟用參數少不等於一般個人電腦可直接承載 |
「原生全模態」也要拆開看。技術報告把影像、影片、音訊與文字編進同一序列,再交給語言模型頭;Artificial Analysis 模型頁同樣列為四種輸入、文字輸出。因此這是整合式多模態理解與工具編排,不是 checkpoint 本身直接輸出圖片、聲音或影片。
「六天 Live RL」的重點,不只是把 GPU 開滿
behind these 6 days lie half a year of foundational research accumulation and engineering trial and error.
中文:這六天背後,是半年的基礎研究累積與工程試錯。
Xiaomi MiMo,〈MiMo-V2.6: Scaling Up Reinforcement Learning for Self-Improvement〉
這句話其實替「六天練出前沿模型」踩了煞車。小米公開的是最後一場 RL 後訓練 live run,不是從資料蒐集、30T/48T-token 預訓練、mid-training、SFT 到 RL 的全部研發工期。依官方 live dashboard 的最終自報數字,Flash 的這次 RL run 約花 85.4 萬美元,Pro 約 262 萬美元;所以「成本低於 100 萬美元」只適用 Flash,不能套在整個系列,更不能改寫成模型總開發成本。
這場訓練每一步取 1,568 個 prompts,每個 prompt 產生 16 條 rollouts,也就是 25,088 條 trajectories;乘上 30 步,算術結果是每個模型 752,640 條。官方英文頁把「each」與「cumulative total 約 750,000」寫在同一句,容易被讀成兩個模型合計;依批次設定,較一致的讀法是每個模型約 75 萬條、兩者合計約 150.5 萬條。
規模之外,方法才是重點。官方將 RL 任務混合設為 68% 程式碼、12% 通用、13% aesthetic、3% context、4% cyber,並把 rollout、訓練與 grader 同時放大。不同 domain 會使用規則 verifier、測試 harness 或 MiMo-V2.6-SFT grader;其中部分高通過率 code tasks 採 Groupwise Reward Synthesis,其餘 code tasks 再以 Groupwise Advantage Redistribution 調整學習訊號。這不是所有任務共用一種 grader 或 reward。

小米自報 Flash 的 DeepSWE average@3 從 48.67 升到 65.68,Pro 從 58.41 升到 72.57;官方 live dashboard 也留下 OOM、grader 網路故障、資料基礎設施錯誤、expert load imbalance 與重啟紀錄。分數曲線不是一路向上,卻在終點高於起點。這種把失敗一併留下的透明度,比只貼最終排行榜更有研究價值。
46 分與第一名:有外部訊號,但範圍比標題窄
截至 2026 年 9 月 22 日,Artificial Analysis Intelligence Index v4.3.2 對 MiMo-V2.6-Pro 的獨立測量為 46.32 分,並把它排在該站「150B 以上開放權重模型」比較組的第 1 名(共 114 個)。這是發布方以外的重要支持:按這套指標與比較組,MiMo-V2.6-Pro 處在當時的領先群。

但這個「第一」不是全世界所有模型、所有任務的總冠軍。Artificial Analysis 把 MiMo 標為 open weights,而且這套 Index 主要量文字與英文能力;它不能替小米的音訊、影片理解或 1M context 品質背書,也無法證明 46 分是由這 30 步 RL 單獨造成。它能回答的是:在固定版本與比較組內,Pro 的文字推理綜合表現很強。
小米自己的 agent benchmark 表也不是全面橫掃。Pro 在 DeepSWE、Terminal-Bench 4.0 與 ExploitBench 等列有強有弱;更重要的是,Epoch AI 對 DeepSWE v1.1 的獨立審查把它評為 flawed,人工確認至少 23/113 題存在 false-negative 問題。這不會自動抹掉 MiMo 的端點增益,卻意味著 live-run average@3 的 72.57 不該被當成毫無誤差的能力刻度。
1M context 是容量,尚不是 1M 推理品質證明
MiMo-V2.6 的 config 確實把 max_position_embeddings 設為 1,048,576。技術報告也說預訓練從 32K 延伸到 256K,mid-training 最後一段再推到 1M;RL 可接受最長 1M 的序列。不過報告揭露的典型 RL trajectory 長度約 110K–150K,公開評測重點則是 coding、agent、visual coding 與 knowledge benchmark。
因此更準確的說法是:1M 是 config 與報告宣稱的可接受上限,但發布材料還不足以證明在接近 1M 的位置仍維持同等可驗證的檢索與推理品質。這不是說 MiMo 做不到,而是容量與有效使用率本來就是兩個問題。把整個 repository、工具 trace 與多個 session 塞進去之前,仍應分長度測引用命中、位置偏差與最終任務成功率。
MIT 標示的開放權重,不等於完整可重現
Hugging Face 官方 collection已公開 Pro、Flash 與 Distill-Qwen-9B 三個 repository,Pro 與 Flash 的 metadata 都標示 license: mit,權重可直接下載。小米也在 GitHub 提供 uni-agent、verl與mimoagent的 mimo-oss 分支,涵蓋 multi-harness gateway、agentic RL recipes、rollout、環境 adapter 與 grader。
這些是實質開放,不只是 API 宣傳;但「可以下載權重」仍不同於「外部團隊能完整重做訓練」。在 2026 年 9 月 22 日版技術報告裡,預訓練資料披露停留在來源類別,尚未延伸到逐項 provenance、完整 filtering/decontamination 稽核與端到端成本帳。官方稱已釋出超過 7,000 個 RL tasks;但截至同日的 release surfaces,本文能確認框架分支,尚無法把每一批實際 task instance 與固定 commit、license 完整對上。因此本文採用「MIT metadata 標示的開放權重與部分訓練資源」,不把它擴寫成已完整重現的 open-source stack。
這是 self-improvement loop,還不是 RSI
Reinforcement learning is the central training paradigm for advancing large foundation models towards self-improvement.
中文:強化學習是推動大型基礎模型走向自我改進的核心訓練方法。
LLM-Core Xiaomi,〈MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement〉技術報告
這裡的關鍵字是 towards。MiMo-V2.6 的 loop 確實讓 policy 產生 trajectories、grader 與 verifier 回饋、RL 再更新權重;而且 grader 本身也是 MiMo 系列模型。這比靜態資料上的一次性微調更接近「模型參與改善模型」。
但外迴路仍由人設計:人決定任務比例、環境、harness、verifier、reward、訓練演算法與 30 步排程。技術報告主張的是在這套固定流程中放大 RL,並未把成果描述成 MiMo 已自主改寫學習方法、選研究方向,再設計與訓練自己的下一代。Anthropic 對 recursive self-improvement 的研究說明把更完整的版本描述為 AI 自主設計與開發後繼者;依這個較嚴格定義,MiMo 展示的是人類設計訓練框架內的自我改善,不是 RSI 已經完成。
AlphaLab 判讀:真正的突破是規模與透明度,不是終點標籤
一、把混合任務 agentic RL 放大,確實是工程貢獻
一個模型同時在 coding、通用工具使用、視覺創作、長 context 與 cyber 環境收集長 trajectory,會碰到不同 harness、grader 延遲、rollout 長尾、GPU 記憶體壓力、expert imbalance 與 reward hacking。MiMo-V2.6 不只報最後分數,也交代凍結 router、增加 grader compute、修正 reward 與處理故障的過程。這份工程訊號值得肯定,即使你對排行榜保持懷疑。
二、終點變好,不代表每項宣傳都由 RL 證明
30 步後的內部 pass rate 與 DeepSWE 終點都上升,顯示這場 run 在發布方量測下帶來改善;但持續用 DeepSWE 看曲線,會讓它成為開發指標,而不是最後才揭曉的盲測。現有第三方 Artificial Analysis 測的是完成後的模型,不是「相同模型、相同資料、只移除這套 RL」的訓練對照實驗,因此不能把 46 分、多模態能力與所有 agent 成績都歸因於這六天。最穩健的結論是「大規模 RL 與強模型一起出現,且發布方量到改善」,不是「六天 RL 已證明通往 RSI」。
三、開放權重提高可檢查性,也把部署現實帶回來
公開權重讓研究者可以量化、微調、檢查行為,這比只提供黑箱 API 多出重要的選擇權;可是 1.02T/309B 的完整權重、MoE 通訊與長 context KV cache 都很重。42B/15B active 是每 token 計算路徑,不是儲存與記憶體需求。若你的目的只是比較任務品質,先測 API;只有具備分散式推論資源、資料治理或客製化需求時,自架評估才合理。
我同意的部分:這次發布示範了開放權重模型如何承接昂貴、長軌跡、跨環境的 RL 後訓練;小米公開 live run、失敗與成本邊界,讓外界能更具體地討論「把 RL 放大」到底要解哪些系統問題。
我保留的部分:46 分支持的是特定版本的文字型綜合評測;公開材料對 1M 的支持主要是 config 與訓練排程,而不是接近上限的品質曲線;六天成本只涵蓋這次 RL run,「towards self-improvement」也不是 RSI 達成證明。這些限制不會讓發布失去價值,反而把真正值得複現的問題標得更清楚。
如果要採用 MiMo-V2.6,先做這四個測試
- 固定 harness,比任務成功率。用同一組 tools、權限、timeout、重試、token budget 與驗收規則,讓 MiMo-V2.6 對照你目前的模型;否則比較到的是系統,不只是模型。
- 把 context 分桶。分成短、100K 左右、250K 以上與接近上限,記錄引用位置、遺漏、矛盾與答案可驗證性,不以「請求成功送出」當長 context 通過。
- 算成功任務成本。納入 input、output、grader、工具、失敗重試與人工修正,再除以真正通過驗收的工作數;不要拿 85 萬美元的訓練 run 成本代替自己的推論經濟性。
- 分開評估 API 與自架。先用 API 決定模型是否值得;再依資料敏感度、吞吐、延遲、TP/EP 拓撲與完整權重負載評估部署,別從 active parameters 推導硬體需求。
如果你正在做多模型路由,可以把 MiMo-V2.6 放進「長 context、agentic coding、成本敏感」的候選組,再用AI 模型路由與評測實戰把品質、延遲與每次成功任務成本接在一起。真正重要的不是它在一張榜上排第幾,而是你的工作能否在相同驗收條件下更穩定地完成。
接著閱讀
左右滑動查看更多推薦
下一步不必先相信或否定「自我改進」這個大標籤:挑 20 至 50 個你真正會交給 agent 的任務,固定環境跑完,再看 MiMo-V2.6 的成功率提升是否足以支付更多 context、工具回合與部署複雜度。






