2026 年 10 月 6 日,Mistral 在官網發布了〈Introducing Mistral Large 4〉,開放 Mistral Large 4 的 API 預覽。這則消息的張力很清楚:資安能力已有值得檢查的成績,公開權重卻仍是下一個交付承諾。能呼叫模型、能證明它適合工作、能自行掌握部署,是三道不同的門。

先讀懂公告的核心主張,再對照模型文件與獨立評測,最後決定現在值得測什麼、月底該驗收什麼。
Mistral Large 4 已經開放什麼?
官方 changelog 把 10 月 6 日的狀態列為 Public Preview,API 模型名稱是 mistral-large-4;同一條更新把公開權重列為「coming soon」。模型卡 列出多模態 MoE、100 萬 token 上下文,以及工具呼叫、結構化輸出等功能。這足以支持「現在可以透過 API 開始評估」,並未把公開下載交付視為已完成。
Weights drop end of this month.
中文:權重預定在本月底釋出。
Mistral,〈Introducing Mistral Large 4〉
以公告日期換成絕對時間,就是 2026 年 10 月底的承諾。對需要自架的人而言,下一步要等到的是檔案、授權條件、執行文件和可固定的版本;預覽 API 的帳號存取與那些交付物各回答不同問題。
參數數字先對帳:公告 49B,模型卡 52B
公告寫約 1 兆總參數、490 億啟用參數;截至 2026 年 10 月 7 日,本次取得的模型卡頁面與瀏覽器文字則寫 1.05 兆總參數、520 億啟用參數,另列 16 億參數的視覺編碼器。這裡保留兩份文件的差異,不替官方猜測 30 億的差額來自哪裡。架構細節釋出後,才有材料對照計數口徑。
MoE 可以想成一個分工團隊:模型保存許多專家的權重,每一步只動用其中一部分。啟用參數描述逐步計算,總參數描述整套模型的容量;兩者都不能單獨算出你的顯存、等待時間或每個完成任務的費用。長上下文還會加入快取與注意力成本。要評估自架,先等具體 checkpoint 與推論配置,再談硬體;別把 49B 或 52B 當成整台機器的容量需求。
Mistral Large 4 的獨立資安成績:81.7% 的分母很重要
Artificial Analysis 的 CyberGym-E2E-AA 頁面 在本次查核時列出 Mistral Large 4 Preview 的 pass@1 為 81.7%,位居該頁所列模型之首。這是評測機構自己發布的結果,不只是公司轉述自己的跑分;它支持的是這一版測試中的發現、重現與修補流程。

先讀評分規則:共 131 個篩選任務,每個專案一題;用 Stirrup harness,每題最多 90 分鐘。通過要求是讓未修補版本出現崩潰、補丁消除那個崩潰、既有功能測試繼續通過。補丁是否真的修掉原始漏洞根因,是另外記錄的第四階段,沒有計入主分數。本文沒有呼叫 Large 4 重跑這套評測。
這個區別直接影響採用。讓一個觸發輸入不再崩潰,是可觀察的進步;證明整類漏洞已消失,還需要不同輸入與根因檢查。我的判斷是:這組獨立結果足以讓防禦團隊把 Large 4 放進候選名單,但驗收仍應要求補丁說明、功能回歸與根因證據,不能把榜單百分比當成安全簽核。
多模態、Coding 與知識工作,該怎麼讀原文?
Mistral 的能力敘事涵蓋程式代理、企業流程、視覺定位、科學計算,以及金融與法律文件。它要展示的不是只會聊天,而是讀圖、查資料、操作工具、交出成果的同一套模型。原文同時引用外部評測與公司內部比較;評測名稱之外,還要看誰執行、用哪個版本與哪些工具。

例如上圖的 0.5 分差距,支持的是公司在這項視覺定位測試報告了較高分數。它沒有回答掃描表格、模糊照片、不同語言文件與長流程交付是否也領先;本文不把這張圖升格為整體多模態第一的證明。你若要處理工程圖,真正值得測的是:模型指出的位置能否對回原圖,尺寸與標籤是否一致,以及錯誤是否能被後續檢查抓住。
Coding 同樣要把「答案」與「交付」分開:補丁能編譯嗎、測試有沒有變弱、需求是否真的完成?法律與金融工作則要求逐項引用、算式與可回查的文件。原文的展示提供測試假設;自己的固定任務提供採用依據。可接著看 Agent 回歸測試,把結果、必經證據與禁止動作分開驗收。
安全圖表另一個細節:93.3% 並非獨占領先

原文報告 B3 攻擊抵抗率 93.3%;它自己的圖也列 GLM-5.3 為 93.3%。此外,原文連到 Lakera 的weak 資料集,資料卡明說這是較低品質版本,並與研究使用的高品質資料分開。本文未取得能獨立確認 Large 4 此分數的完整跑次,所以保留為公司在該圖報告的比較,不宣稱通過完整安全認證。
「會做防禦工作」和「不受惡意內容誘導」是兩個能力。再加上「會拒絕哪些請求」,就有第三個維度;高分模型仍可能在某種工具權限與輸入組合下出錯。公告提到讓經審核合作方使用較低 moderation 的存取路徑,不能直接照搬成公開 API 的行為承諾。對組織而言,自訂政策的價值,應與隔離、工具授權和操作紀錄一起驗收。
還在訓練:預覽應當是一個可固定的測試對象
The reinforcement learning run behind this preview is still in flight
中文:這個預覽背後的強化學習訓練仍在進行。
Mistral,〈Introducing Mistral Large 4〉

Mistral 把可組合任務環境、非同步生成與驗證,當成持續改善能力的引擎;它也把自有歐洲基礎設施與未來專用模型放進同一個故事。這能解釋公司的方向,卻不能由訓練曲線推得你下週的工作一定更快。我的推論是:越持續更新的預覽,越需要保存模型回應中的版本、執行日期、提示、工具配置和完整結果。
若只有一個會變動的 API alias,這週與下週的比較就可能混入後端更新。保存固定題集並在變更後重跑,比記住發布時的一張榜單有用。模型身分查核收據可以補上交付紀錄;Reflection Beam 的權重預告分析則提供另一個把承諾與交付分開的案例。
AlphaLab 的判讀:現在測能力,交付後再談自主部署
我同意:獨立亮點值得換成自己的測例
CyberGym-E2E-AA 的成績提供了具體理由:如果你的瓶頸是重現漏洞與提出補丁,可以在隔離的自有測試庫中評估 Large 4。重點是讓模型交出能否證的成果,而不是詢問它認為自己多強。先預寫錯誤情境與必要證據,完成後再計算通過率、總耗時和人工收尾。
我存疑:把單項排名換成通用領先或全面安全
每項評測有自己的任務、分母、工具與通過條件。根因修補沒有納入資安主分數、公司視覺圖差距很小、安全圖有並列值,這三個細節都阻止我們把選定工作負載的成績外推到全部工作。這不是否定模型;是讓它的優勢落在真的被量到的位置。
真正的自主控制,要同時拿到檔案與運行能力
開放權重的潛在價值,是組織可以固定版本、調整部署與政策,降低對單一服務入口的依賴。但檔案可取得、授權允許你的用途、硬體跑得起、工具和資料流可控,四者都成立,才變成實際選項。現在可以把這四項寫進月底驗收表;本機模型的記憶體與 Agent 驗收能幫你先理解容量與可用性的差別。
接下來追三張證據,而不是三句口號
第一張是 API 任務收據:用不含敏感資料的相同任務,記下模型版本、工具、成果、錯誤、費用與總時間。這能回答「現在適不適合我的工作」。
第二張是評測條件表:分開列獨立與公司結果,核對任務版本、拒絕策略、樣本數、根因檢查與重跑紀錄。這能回答「新聞裡的領先到底支持哪一項能力」。
第三張是權重交付表:到 2026 年 10 月底核對官方下載、授權、模型卡、推論支援與參數計數。拿到之後再用相同任務驗自架配置,這能回答「可控制的替代方案是否真的成立」。
接著閱讀
左右滑動查看更多推薦
Mistral Large 4 已值得成為一個測試對象。今天先挑一件能用證據驗收的工作,月底再核對權重交付;讓這兩次查驗決定你是否採用,而不是讓「1 兆參數」替你做決定。





