跳到主要內容

Apodex 1.1 深度解析:35B Mini 真的追上前沿?(2026)

最後更新: ·
Apodex 1.1 Mini 35B benchmark 圖與真的追上前沿提問

2026 年 8 月 24 日,Apodex Team 在 arXiv 提交技術報告 〈Apodex 1.1: Scaling Agentic Intelligence for Complex Work〉,並讓託管的完整工作台上線;多 Agent 執行框架 FrontierAgent 隨這波發布開源,35B Mini 權重則在 8 月 25 日登上 Hugging Face。真正值得追問的,不是「又一個模型拿到幾分」,而是它能不能把一次答對,變成一段可持續、可恢復、可驗證的工作。

Apodex 1.1 技術報告在 arXiv 的標題與摘要頁面
圖/arXiv(論文於 2026 年 8 月 24 日提交)

Apodex 1.1 把「回答」改成「完成工作」

Apodex 對這種能力的命名是 working capability。論文不是把長上下文、多工具或多 Agent 各自當成終點,而是問:系統能否在檔案、搜尋、程式碼與外部證據之間維持任務狀態,遇到失敗後繼續推進,最後交出能被檢查的產物。

“The unit of this capability is completed work rather than an isolated response.”

中文:「這種能力的單位,是完成的工作,而不是一則孤立的回覆。」

Apodex Team,Apodex 1.1 技術報告

這句話點出整份報告最有價值的轉向。聊天模型的輸出通常停在一段文字;工作型 Agent 則必須留下檔案、程式、引用、執行紀錄與驗收結果。也因此,模型本身只是一部分,執行環境與協作機制同樣會決定最後分數。想先理解這一層,可以對照 AlphaLab 的 AI Agent Harness 介紹

真正的新東西:模型、AgentOS 與 FrontierAgent 綁成一個系統

Apodex 1.1 的方法可拆成兩條軸。第一條是 Environment Scaling:建立能真的讀寫檔案、搜尋資料、執行程式、保存狀態並接受終局驗證的工作環境。第二條是 Agentic Coordination Scaling:讓主 Agent 能拆任務、建立專家、平行委派、吸收中途結果、重新規劃並做證據整合。

Apodex Agent Team 主 Agent、任務看板與專家子 Agent 的協作流程圖
圖/Apodex 官方發布文章;Agent Team 以主 Agent、任務看板與專家子 Agent 組織工作

AgentOS 把工作區檔案、檢索證據、工具執行紀錄、產物索引、依賴關係與執行控制狀態放進同一套運作契約。Agent Team 再加上 lead agent、動態建立的 specialist、task board 與訊息匯流層。FrontierAgent 則把 ReAct 與 Agent Team 工作流、終端介面、工具、已保存 session 的續跑和評測 harness 開源出來,授權為 Apache-2.0;這不代表 Agent Team 的所有狀態都能做原子式復原。

這裡最容易誤解的是「多 Agent」三個字。論文的重點不是多開幾個平行樣本,而是讓任務、決策、使用者回饋與子任務成果持續流過同一個工作狀態。換句話說,真正的產品不是一群聊天視窗,而是能管理依賴、故障與交付的執行系統。

35B Mini 開放了什麼,完整模型又留下了什麼

這次發布最需要守住的事實界線,是完整 Apodex 1.1 不等於 35B Mini。官方 模型文件把未加 Mini 的 Apodex 1.1 列為 397B,並把 Apodex 1.1 Mini 另列為 35B;論文的主要完整系統表格與 Mini 表格也分開呈現。

層級目前公開方式不能混在一起的地方
完整 Apodex 1.1官方工作台與 API;官方文件標示 397B完整系統的 Agent Team 高分,不是 35B Mini 的分數
Apodex 1.1 Mini35B 權重與量化版本;Apache-2.0以 Qwen3.5-35B-A3B 為底,論文另有 Mini 專屬評測
FrontierAgent開源 runtime、工作流與評測 harness框架可以接 OpenAI-compatible endpoint,但不包含完整 397B 權重

截至 2026 年 8 月 26 日,官方 Apodex 1.1 Collection列出 Mini 的原始、FP8、NVFP4 與 GPTQ-Int4 版本,未列出完整 397B 權重。Mini 的 BF16 分片合計約 72GB,官方 serving 範例使用 vLLM 或 SGLang 並示範 tensor parallelism 8。這表示「可在自己的基礎設施部署」是真的,但不能偷換成「一般筆電一鍵輕鬆跑」。

“Being able to give a correct answer and being able to see a piece of work through to completion, verifiably, are two different capabilities.”

中文:「能答對,和能把一件工作可驗證地做到底,是兩種不同能力。」

Apodex 官方發布文章

榜單看起來亮眼,但不能把系統分數當模型分數

Apodex 的作者自報結果確實有值得看的部分。完整 Apodex 1.1 在 Agent Team 模式下報告 APEX-Agents 38.5、GDPVal 78.8、FrontierFinance 54.3、FrontierScience-Research 63.3;官方模型文件把表中未加 Mini 的產品識別為 397B。不過這些都是模型加 harness、工具與額外協作推論預算的結果,不是裸模型一次生成的能力。

GDPVal 的 78.8 還有一層可重現性限制:現行開源 evaluator 明確排除原始 pairwise quality grader,只檢查產物是否存在且可讀。因此 78.8 應視為作者自報 win rate;公開 harness 目前不能重現這個品質評分,也不能把它寫成 78.8% accuracy。

Apodex 1.1 完整系統在六項基準的作者自報比較圖
圖/Apodex 官方發布文章;完整 Apodex 1.1 的六項比較屬作者自報,藍色 Agent Team 列是系統層結果

Mini 的數字必須看另一張表。依技術報告,35B Mini 從 ReAct 切到 Agent Team 後,三項成績如下:

基準Mini ReActMini Agent Team差距
APEX-Agents24.227.7+3.5
FrontierFinance40.050.2+10.2
FrontierScience-Research45.051.7+6.7
資料來源:Apodex 1.1 技術報告,Table 5;均為作者執行與回報
Apodex 1.1 Mini 在 APEX、FrontierFinance 與 FrontierScience 的作者自報成績圖
圖/Apodex 官方發布文章;35B Mini 的三項專屬比較,不應與以 397B 模型為核心的完整系統成績互換

這三組變化支持一個有限但重要的判讀:同一個 Mini 模型換成有組織的 Agent Team 後,作者測到更高基準分數。然而報告沒有提供等計算量的 ReAct 對照,也沒有為主要表格全面提供信賴區間與重複次數。Agent Team 用了更多、而且被更好組織的推論計算;它證明的是系統設計可能有用,不是「多 Agent 免費創造智力」。

三個容易被發布標題藏起來的限制

一、目前主要證據仍由作者自己提供

論文是 arXiv 預印本,並未標示同儕審查會議。主要成績來自 Apodex 自己的測試;外部模型比較列有些是文獻數字,有些則由 Apodex 在自家 harness 重跑,並不是一場條件完全一致的統一對決。截至 2026 年 8 月 26 日,本文尚未找到非 Apodex 團隊對這些主要分數的獨立重測,因此把它們稱為「作者自報」,不把它們當成獨立重現。

Mini 模型卡表示,評測時封鎖了相關 benchmark 網站,這能降低即時搜尋答案的風險;截至 2026 年 8 月 26 日,本文查閱的技術報告與 Mini 模型卡未披露訓練截止日、訓練/評測去重結果或污染稽核。封鎖測試時的網站,不能等同於證明訓練資料沒有看過測題。

二、榜單測到的是 model–harness system

報告自己在 FrontierResearchBench 明說,每一列都是模型與 harness 的組合。Apodex 1.1 加 FrontierAgent 得到 12.4%,Apodex 1.1 加 Claude Code 得到 10.3%,都低於表中最佳組合的 20.6%;作者也承認 Apodex 在這項測試仍落後前沿系統。這是很好的反例:它阻止我們把幾個有利 benchmark 擴張成「全面追上前沿」。

三、可恢復不等於永不丟狀態,可驗證也不等於一定正確

論文披露,協調平面的狀態目前保存在單次 worker process 中,沒有和檔案系統做原子 checkpoint;完整的 process-restart recovery 與歷史回捲不在現有契約內。發布保護也是工具層控制,不是監看所有系統呼叫的檔案防火牆。更根本的是,runtime 可以要求引用與產物,卻不能保證來源、計算、科學方法或結論本身正確。

AlphaLab 的判讀:方向比名次更值得注意

我們同意 Apodex 對問題的重新定義。當 Agent 開始承接數小時甚至數天的工作,評估單位本來就不該只是單輪答案。任務狀態、可追溯證據、失敗恢復、產物驗收和使用者介入,都應該成為能力的一部分。FrontierAgent 與 Mini 權重的開放,也讓外部研究者至少有機會檢查 runtime、重跑一部分流程,而不是只能看錄好的展示。

但我們不同意把目前結果壓縮成「35B 已追上所有前沿模型」。完整系統與 Mini 是兩個尺度;Agent Team 與 ReAct 不是等推論預算;比較列也不是全部同條件重跑。最合理的結論是:35B Mini 在作者選定的三項工作型基準上,搭配 Agent Team 後進入作者所選比較列中若干前沿系統的成績帶;這是一個值得外部重現的訊號,不是已被證明的普遍優勢。

長期來看,Apodex 1.1 最可能留下的不是某個小數點,而是「完成的工作」這個測量單位。如果未來的模型發布都必須交出可重播軌跡、檔案差異、工具版本、驗收器和失敗案例,AI Agent 的競賽才會從 demo 感,走向真正可審計的工程。

你現在該怎麼驗證 Apodex 1.1

  1. 固定模型與任務:先用同一個 Mini endpoint、同一批私有任務,比較 ReAct 與 Agent Team,不要拿不同模型混比。
  2. 固定預算:記錄 token、工具呼叫、牆鐘時間與重試次數,再做等成本比較;否則分數提升可能只是更多推論。
  3. 檢查失敗路徑:刻意中斷 worker、讓搜尋回傳錯誤、改動檔案,確認 checkpoint、artifact hash、trace 與最終驗收能否說明發生了什麼。

如果想把這套方法變成自己的測試表,可接著看 AI Evals 教學;若要理解為何多 Agent 不一定划算,則可對照 Munder Difflin 的單/多 Agent 對照設計

接著閱讀

左右滑動查看更多推薦

如果只做一件事:不要先問 Apodex 的榜單名次,先拿一個你能人工驗收、允許中途失敗的真實任務,測它能不能留下可追溯產物並在相同預算下穩定完成。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。