2026 年 8 月 24 日,Apodex Team 在 arXiv 提交技術報告 〈Apodex 1.1: Scaling Agentic Intelligence for Complex Work〉,並讓託管的完整工作台上線;多 Agent 執行框架 FrontierAgent 隨這波發布開源,35B Mini 權重則在 8 月 25 日登上 Hugging Face。真正值得追問的,不是「又一個模型拿到幾分」,而是它能不能把一次答對,變成一段可持續、可恢復、可驗證的工作。

Apodex 1.1 把「回答」改成「完成工作」
Apodex 對這種能力的命名是 working capability。論文不是把長上下文、多工具或多 Agent 各自當成終點,而是問:系統能否在檔案、搜尋、程式碼與外部證據之間維持任務狀態,遇到失敗後繼續推進,最後交出能被檢查的產物。
“The unit of this capability is completed work rather than an isolated response.”
中文:「這種能力的單位,是完成的工作,而不是一則孤立的回覆。」
Apodex Team,Apodex 1.1 技術報告
這句話點出整份報告最有價值的轉向。聊天模型的輸出通常停在一段文字;工作型 Agent 則必須留下檔案、程式、引用、執行紀錄與驗收結果。也因此,模型本身只是一部分,執行環境與協作機制同樣會決定最後分數。想先理解這一層,可以對照 AlphaLab 的 AI Agent Harness 介紹。
真正的新東西:模型、AgentOS 與 FrontierAgent 綁成一個系統
Apodex 1.1 的方法可拆成兩條軸。第一條是 Environment Scaling:建立能真的讀寫檔案、搜尋資料、執行程式、保存狀態並接受終局驗證的工作環境。第二條是 Agentic Coordination Scaling:讓主 Agent 能拆任務、建立專家、平行委派、吸收中途結果、重新規劃並做證據整合。

AgentOS 把工作區檔案、檢索證據、工具執行紀錄、產物索引、依賴關係與執行控制狀態放進同一套運作契約。Agent Team 再加上 lead agent、動態建立的 specialist、task board 與訊息匯流層。FrontierAgent 則把 ReAct 與 Agent Team 工作流、終端介面、工具、已保存 session 的續跑和評測 harness 開源出來,授權為 Apache-2.0;這不代表 Agent Team 的所有狀態都能做原子式復原。
這裡最容易誤解的是「多 Agent」三個字。論文的重點不是多開幾個平行樣本,而是讓任務、決策、使用者回饋與子任務成果持續流過同一個工作狀態。換句話說,真正的產品不是一群聊天視窗,而是能管理依賴、故障與交付的執行系統。
35B Mini 開放了什麼,完整模型又留下了什麼
這次發布最需要守住的事實界線,是完整 Apodex 1.1 不等於 35B Mini。官方 模型文件把未加 Mini 的 Apodex 1.1 列為 397B,並把 Apodex 1.1 Mini 另列為 35B;論文的主要完整系統表格與 Mini 表格也分開呈現。
| 層級 | 目前公開方式 | 不能混在一起的地方 |
|---|---|---|
| 完整 Apodex 1.1 | 官方工作台與 API;官方文件標示 397B | 完整系統的 Agent Team 高分,不是 35B Mini 的分數 |
| Apodex 1.1 Mini | 35B 權重與量化版本;Apache-2.0 | 以 Qwen3.5-35B-A3B 為底,論文另有 Mini 專屬評測 |
| FrontierAgent | 開源 runtime、工作流與評測 harness | 框架可以接 OpenAI-compatible endpoint,但不包含完整 397B 權重 |
截至 2026 年 8 月 26 日,官方 Apodex 1.1 Collection列出 Mini 的原始、FP8、NVFP4 與 GPTQ-Int4 版本,未列出完整 397B 權重。Mini 的 BF16 分片合計約 72GB,官方 serving 範例使用 vLLM 或 SGLang 並示範 tensor parallelism 8。這表示「可在自己的基礎設施部署」是真的,但不能偷換成「一般筆電一鍵輕鬆跑」。
“Being able to give a correct answer and being able to see a piece of work through to completion, verifiably, are two different capabilities.”
中文:「能答對,和能把一件工作可驗證地做到底,是兩種不同能力。」
Apodex 官方發布文章
榜單看起來亮眼,但不能把系統分數當模型分數
Apodex 的作者自報結果確實有值得看的部分。完整 Apodex 1.1 在 Agent Team 模式下報告 APEX-Agents 38.5、GDPVal 78.8、FrontierFinance 54.3、FrontierScience-Research 63.3;官方模型文件把表中未加 Mini 的產品識別為 397B。不過這些都是模型加 harness、工具與額外協作推論預算的結果,不是裸模型一次生成的能力。
GDPVal 的 78.8 還有一層可重現性限制:現行開源 evaluator 明確排除原始 pairwise quality grader,只檢查產物是否存在且可讀。因此 78.8 應視為作者自報 win rate;公開 harness 目前不能重現這個品質評分,也不能把它寫成 78.8% accuracy。

Mini 的數字必須看另一張表。依技術報告,35B Mini 從 ReAct 切到 Agent Team 後,三項成績如下:
| 基準 | Mini ReAct | Mini Agent Team | 差距 |
|---|---|---|---|
| APEX-Agents | 24.2 | 27.7 | +3.5 |
| FrontierFinance | 40.0 | 50.2 | +10.2 |
| FrontierScience-Research | 45.0 | 51.7 | +6.7 |

這三組變化支持一個有限但重要的判讀:同一個 Mini 模型換成有組織的 Agent Team 後,作者測到更高基準分數。然而報告沒有提供等計算量的 ReAct 對照,也沒有為主要表格全面提供信賴區間與重複次數。Agent Team 用了更多、而且被更好組織的推論計算;它證明的是系統設計可能有用,不是「多 Agent 免費創造智力」。
三個容易被發布標題藏起來的限制
一、目前主要證據仍由作者自己提供
論文是 arXiv 預印本,並未標示同儕審查會議。主要成績來自 Apodex 自己的測試;外部模型比較列有些是文獻數字,有些則由 Apodex 在自家 harness 重跑,並不是一場條件完全一致的統一對決。截至 2026 年 8 月 26 日,本文尚未找到非 Apodex 團隊對這些主要分數的獨立重測,因此把它們稱為「作者自報」,不把它們當成獨立重現。
Mini 模型卡表示,評測時封鎖了相關 benchmark 網站,這能降低即時搜尋答案的風險;截至 2026 年 8 月 26 日,本文查閱的技術報告與 Mini 模型卡未披露訓練截止日、訓練/評測去重結果或污染稽核。封鎖測試時的網站,不能等同於證明訓練資料沒有看過測題。
二、榜單測到的是 model–harness system
報告自己在 FrontierResearchBench 明說,每一列都是模型與 harness 的組合。Apodex 1.1 加 FrontierAgent 得到 12.4%,Apodex 1.1 加 Claude Code 得到 10.3%,都低於表中最佳組合的 20.6%;作者也承認 Apodex 在這項測試仍落後前沿系統。這是很好的反例:它阻止我們把幾個有利 benchmark 擴張成「全面追上前沿」。
三、可恢復不等於永不丟狀態,可驗證也不等於一定正確
論文披露,協調平面的狀態目前保存在單次 worker process 中,沒有和檔案系統做原子 checkpoint;完整的 process-restart recovery 與歷史回捲不在現有契約內。發布保護也是工具層控制,不是監看所有系統呼叫的檔案防火牆。更根本的是,runtime 可以要求引用與產物,卻不能保證來源、計算、科學方法或結論本身正確。
AlphaLab 的判讀:方向比名次更值得注意
我們同意 Apodex 對問題的重新定義。當 Agent 開始承接數小時甚至數天的工作,評估單位本來就不該只是單輪答案。任務狀態、可追溯證據、失敗恢復、產物驗收和使用者介入,都應該成為能力的一部分。FrontierAgent 與 Mini 權重的開放,也讓外部研究者至少有機會檢查 runtime、重跑一部分流程,而不是只能看錄好的展示。
但我們不同意把目前結果壓縮成「35B 已追上所有前沿模型」。完整系統與 Mini 是兩個尺度;Agent Team 與 ReAct 不是等推論預算;比較列也不是全部同條件重跑。最合理的結論是:35B Mini 在作者選定的三項工作型基準上,搭配 Agent Team 後進入作者所選比較列中若干前沿系統的成績帶;這是一個值得外部重現的訊號,不是已被證明的普遍優勢。
長期來看,Apodex 1.1 最可能留下的不是某個小數點,而是「完成的工作」這個測量單位。如果未來的模型發布都必須交出可重播軌跡、檔案差異、工具版本、驗收器和失敗案例,AI Agent 的競賽才會從 demo 感,走向真正可審計的工程。
你現在該怎麼驗證 Apodex 1.1
- 固定模型與任務:先用同一個 Mini endpoint、同一批私有任務,比較 ReAct 與 Agent Team,不要拿不同模型混比。
- 固定預算:記錄 token、工具呼叫、牆鐘時間與重試次數,再做等成本比較;否則分數提升可能只是更多推論。
- 檢查失敗路徑:刻意中斷 worker、讓搜尋回傳錯誤、改動檔案,確認 checkpoint、artifact hash、trace 與最終驗收能否說明發生了什麼。
如果想把這套方法變成自己的測試表,可接著看 AI Evals 教學;若要理解為何多 Agent 不一定划算,則可對照 Munder Difflin 的單/多 Agent 對照設計。
接著閱讀
左右滑動查看更多推薦
如果只做一件事:不要先問 Apodex 的榜單名次,先拿一個你能人工驗收、允許中途失敗的真實任務,測它能不能留下可追溯產物並在相同預算下穩定完成。






