2026 年 8 月 21 日,NVIDIA 研究團隊在 Developer Technical Blog 發布了〈NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Purpose Architecture for Long-Horizon Autonomous Agents〉。這篇文章把聚光燈從「又一個更強模型」移到模型外面的系統:NVIDIA 稱它把同一套 NVIDIA AVO 長時程 agent substrate,從連續七天的 GPU kernel 搜尋接到 ARC-AGI-3,搭配 Claude Opus 5 跑完公開示範集的 183 個關卡。
NVIDIA 回報的 100% 有明確範圍,但也最容易被讀錯。它不是 ARC-AGI-3 私有評測滿分,不是 Claude Opus 5 從 30% 被 AVO 單獨拉到 100% 的受控實驗,更不是第一次有人跑完這套公開關卡。真正值得研究的是:當模型、記憶、工具、觀察介面、評分器與恢復機制被組成一個可以長時間運作的閉環,能力會呈現什麼不同的樣子?

下面先忠實拆解 AVO 的運作方式與兩組實驗,再把公開集、私有集、模型基線和跨系統比較逐一對齊,最後回答一個更實用的問題:以後看到「Agent 滿分」,究竟該看模型,還是看 harness?
一、AVO 是什麼?它把一次回答變成持續改進的迴圈
如果把模型比喻成一顆引擎,Agent Harness 就是傳動、儀表、煞車、導航與維修系統。模型負責推理與生成;harness 決定它看到什麼上下文、能用哪些工具、如何保留狀態、何時驗證、失敗後怎麼回復,以及工作能不能跨過一次 context window 繼續下去。
“The model matters, but the model is not the entire agent.”
中文:「模型很重要,但模型並不是整個 Agent。」
— NVIDIA AVO 研究文章
NVIDIA AVO(Agentic Variation Operators)把一般 coding agent 放進一個反覆運轉的搜尋流程:先讀取既有候選、分數、文件和程式碼,接著規劃、實作、執行評測、診斷失敗,再決定下一個修改方向。只有通過正確性檢查、表現不退步的候選才進入已接受的 lineage;失敗嘗試則成為下一輪推理的材料。

兩個機制特別關鍵。第一是持久記憶:先前版本、編譯器錯誤、profiler 結果與推理脈絡不必每輪重建。第二是supervisor:當搜尋停滯或反覆繞圈時,另一層監督機制可以把主 agent 導向替代方向。AVO 論文把它描述為 self-supervision,並稱七天 kernel 搜尋過程沒有人工逐步介入;這裡的「自主」指的是人類先設計好知識庫、工具、評分函數與邊界後,系統自行走完迭代,而不是沒有任何人類工程。
這個迴圈不是憑空出現:ReAct 早已把推理與外部行動交錯,Reflexion 把環境回饋寫進 episodic memory,Voyager 也展示了工具、記憶與自我驗證支撐的長期探索。AVO 較有辨識度的貢獻,不是發明「回饋+記憶」,而是把自我導向的 coding agent 放到 evolutionary search 的 variation operator 位置,並用七天 B200 實驗展示它能持續工作。
二、七天 GPU kernel 搜尋:AVO 最扎實、也最受限的證據
NVIDIA 在 2026 年 3 月上傳的 AVO 論文,先把這套方法用在 Blackwell B200 的 attention kernel 最佳化。作者回報 AVO 連續運轉七天、探索超過 500 個最佳化方向,最後留下 40 個已提交版本。測試環境是 NVIDIA B200、CUDA 13.1、PyTorch 2.10.0;基準包含 cuDNN 9.19.1 與固定在 2026 年 3 月版本(commit 71bf77c)的 FlashAttention-4,並沿用 FA4 timing script,重複量測十次取平均與標準差。
最亮眼的「快 10.5%」有明確邊界:最高值出現在 BF16、head dimension 128、16-head、forward prefilling、因果遮罩 MHA、4K sequence/batch 8 這一格。四組因果遮罩設定中,相對 cuDNN 的增幅範圍是 0.4%–3.5%,相對當時固定版本的 FA4 是 5.0%–10.5%;這不是目前 FA4、所有 attention workload 或整體模型推論的普遍加速。在非因果遮罩、較短序列的設定,論文則說差距落在量測雜訊內。後續把 MHA kernel 改成兩種 Qwen3 型 GQA 配置,作者稱約 30 分鐘完成,最高分別領先 cuDNN 7.0%、FA4 9.3%。
這組實驗比「agent 寫出一段看起來能跑的 code」更有說服力,因為依論文流程,每次修改都要通過內部數值正確性和實機 throughput 評測;未通過正確性檢查的候選得零分,退步版本不會被接受。它支持 AVO 至少能在一個目標清楚、回饋快速、評分可機械驗證的工程空間裡,把數百次嘗試累積成有效進展。
但它仍是 NVIDIA 團隊對自家 B200 實驗的報告,不應外推成「所有 workload 都快 10.5%」。論文本身也提醒,公開的 trajectory 只呈現 40 個成功提交,並不是 500 多個內部方向的完整搜尋樹。最合理的讀法是:AVO 展示了一個值得重現的長期最佳化方法;10.5% 是特定配置下的最高值,不是普遍保證。
三、ARC-AGI-3 的 100%:完成了什麼,又沒有完成什麼?
ARC-AGI-3 把傳統靜態問答改成互動式遊戲。Agent 一開始不知道規則、目標或物件用途,只能選擇動作、觀察環境改變、建立假設,再把學到的機制帶進後續關卡。RHAE(Relative Human Action Efficiency)同時計算完成度與相對首次人類玩家的動作效率;要注意的是,只有環境動作進入這個分數,內部推理、讀取記憶或檢查畫面不算 action,也不是成本或延遲指標。每關效率分最高可到 115,整體 game score 再以完成度封頂 100,因此總分 100 不等於每一關都零失誤或每一步都比人類快;但 AVO 確實回報完成了全部 183 關。

NVIDIA 回報的結果是 25 個公開環境全破、183/183 關、100.00 RHAE,共使用 6,624 個 scored environment actions。這些數字採用 ARC 的官方計分格式,但本文仍按「NVIDIA 回報」處理,不把 official scorecard 格式誤寫成 ARC Prize 獨立驗證。文章選擇和 MIT 團隊的 VISTA 比較:VISTA 也以 Claude Opus 5 完成同一批 183 關,回報 7,542 個動作;依兩邊公布的總數計算,AVO 少約 12.2%。
不過,這不是當時最接近的已公開結果。Tycho 論文在 7 月底已回報同樣以 Claude Opus 5 跑完 183 關、100.00 RHAE,共 6,641 個 scored actions。若兩邊的 action 計數口徑可比,AVO 的 6,624 只少 17 個,約 0.26%。VISTA 的 12.2% 對照數學上成立,但 Tycho 的 17 步差距是更接近的同時期參考。
“This should not be interpreted as a controlled ablation.”
中文:「這不應被解讀成受控的消融實驗。」
— NVIDIA AVO 研究文章
這句但書比 12% 本身更重要。VISTA 主要把 64×64 狀態放大成 512×512 PNG 給多模態模型看,並公開使用 Opus 5 xhigh;AVO 則傳入精確的 64×64 純文字 grid,但沒有揭露可一對一核對的確切 reasoning effort。兩邊的 agent backend、記憶、context 管理與其他實作細節也不同。所以 6,624 對 7,542 只能說「兩套完整系統的已回報結果不同」,不能單獨歸因給 AVO 的持久記憶或 supervisor。
文字 grid 序列化、ARC 專用工具與 evaluator 也不是無關痛癢的接線:它們會改變模型看到的問題與可採取的動作。更準確的說法是,NVIDIA 把既有長時程 substrate 接上新的 task adapter,而不是拿完全相同的設定做盲測。要證明核心架構真正 transfer,還需要公開哪些模組完全不變、adapter 改了什麼,以及在開發者未見的環境上一次性測試。
同樣地,ARC Prize 在 2026 年 7 月 24 日公布的 Claude Opus 5 High Verified 分數 30.16%來自 55 個 semi-private 環境;AVO 的 100 則來自 25 個 open Public Demo,NVIDIA 也明確說 reasoning setting、agent system 與 evaluation setup 不同。把 30.16% 和 100% 相減,不能得到「AVO 貢獻 69.84 個百分點」。要量出架構本身的貢獻,至少要在同一批環境固定模型、推理強度、觀察格式、工具與預算,再逐一拿掉記憶、supervisor 或 context 策略重跑。
目前公開的 NVIDIA 文章與所連論文,也沒有提供這次 ARC run 的確切模型 snapshot/effort/sampling、attempt 與 restart 規則、best-of-N 或失敗 run 計法、memory 跨關或跨遊戲範圍、supervisor 身分與觸發條件、ARC run 是否有人介入、完整 prompt/tool schema、GPU 版與 ARC 版 config diff,以及可公開核算的 scorecard ID 與 replay。這些缺口不會自動推翻 6,624,但會讓「架構完全相同」「runtime 全自主」與「可獨立重現」仍停留在待驗證。VISTA 團隊還提醒:Opus 5 在公開遊戲之後推出,不能排除模型訓練資料曾接觸公開題或 replay;同一個 caveat 也適用於 AVO。
四、公開滿分不是私有評測,更不是 AGI 成績
ARC-AGI-3 技術報告把資料分成 25 個 Public Demo、55 個 Semi-Private 與 55 個 Fully Private 環境。報告把公開集定位為讓人理解格式與基本機制的「front door」,把 private set 定位為分布與公開機制不同、用來更嚴格測試泛化的 holdout。無論不同版本的難度如何變動,最關鍵的邊界都不變:公開題已曝光,semi-private 與 fully private 才是未公開評測。
ARC Prize 的立場甚至更直接:因為公開環境可以被反覆看見、針對性調整,官方 leaderboard 不會用公開集分數衡量 AGI 進展。ARC 的 Community Leaderboard 也提醒,ARC-AGI-3 公開集分數原則上是 self-reported;它列出 Tycho 在 7 月 29 日回報 100.0%。VISTA 則在自己的專案頁於 8 月 5 日發布完整 25-game 滿分結果。NVIDIA 的 8 月 21 日成果因此不是第一個公開集滿分。更關鍵的是,Tycho 的 executable world model、VISTA 的極簡 visual harness 與 AVO 的文字 grid 加持久記憶都能到頂,代表公開集已出現「多條不同路徑同時飽和」;單看 100 分,已很難辨認哪個架構元件才是原因。
這不會讓 AVO 失去價值,卻會收窄它能支持的命題。目前材料最多支持:NVIDIA 所描述的完整 AVO 系統,在已公開的 25 個環境裡回報完成所有關卡,並回報比 VISTA 少的環境動作。它尚未證明同一套配置能在 110 個未公開環境維持優勢,也沒有把「跨兩個任務可運作」直接升格成廣義通用智能。
五、真正的新訊號:模型分數不等於完整 Agent 表現
AVO 最有意思的地方,不是把一張榜單塗成綠色,而是把兩個表面完全不同的工作化成同一個計算模式:
- GPU kernel:提出最佳化假設、改 code、跑 correctness 與 profiler、保留有效版本、從錯誤修正。
- ARC-AGI-3:猜測世界規則、採取動作、觀察結果、保留已學機制、推翻錯誤假設。
兩者共同依賴的不是特定領域答案,而是「假設 → 行動 → 可驗證回饋 → 記憶 → 修復」的閉環。這也是為什麼單看模型 benchmark 會逐漸不夠:同一顆模型放進不同的觀察格式、工具權限、memory policy、停止條件和 evaluator,最後表現可能像不同產品。
但「harness 很重要」不等於「harness 比模型重要」。沒有 Claude Opus 5 的底層能力,AVO 未必能形成高品質假設;沒有 harness,那些能力又很難跨數千次互動穩定累積。兩者是乘法關係,任一項接近零,整體都會崩掉。AVO 的材料支持「模型不是全部」,還不足以替模型與 harness 排出一個普遍順位。
六、我同意什麼;我對什麼仍然保留
我同意 NVIDIA 的核心方向:長時間 Agent 應該以完整系統評估。能否保留狀態、使用真實工具、接受外部回饋、辨識停滯與從錯誤恢復,確實決定模型能力能不能累積。相較一次性的 demo,七天 kernel 搜尋尤其接近真實工程價值,因為正確性與速度都可被機器檢查。
我對三個跳躍仍然保留:第一,30.16%→100% 不是 AVO 的淨貢獻;第二,公開集滿分不能代表未見環境的泛化;第三,跨 kernel 與公開遊戲兩個場景,仍不足以確認「general-purpose」能延伸到模糊目標、慢速回饋或錯誤評分器的現實工作。當 evaluator 很可靠時,agent 可以高速爬山;當「做對」本身難以定義時,記憶也可能把錯誤方向保存得更久。
我也不會把它直接當成 production-ready 證據。本文檢視的 NVIDIA 材料沒有報告 ARC 的 token/API cost/wall-clock、kernel 搜尋使用幾張 B200、多少 GPU-hours 或 agent inference 成本,也沒有交代 sandbox、network egress、credential scope、audit log、kill switch 與 rollback 控制。這些營運與安全缺口不會改寫 benchmark 分數,卻會阻止我們從一個研究環境直接推導 ROI、可靠性或上線安全。
所以我的結論不是把 AVO 降格成行銷,也不是把它捧成通用智能。它是一個強而有邊界的訊號:前沿模型的下一段進步,很可能不只來自下一次權重更新,也來自讓推理、工具、回饋與狀態在時間上累積的工程。真正的考驗,會是固定條件的消融實驗、未見環境成績、重複執行的變異、成本與延遲,以及其他團隊能否得到相近結果。
七、看到下一個「Agent 滿分」,先問這六個問題
- 考的是公開題還是 holdout?公開題適合開發,私有題才比較接近泛化。
- 比較時模型與 reasoning effort 有沒有固定?不固定,就無法把差異歸因給 harness。
- 觀察格式、工具與預算是否相同?PNG、文字 grid、額外讀取和內部推理成本都會改變結果。
- 分數計算了什麼、漏掉什麼?環境 action 少,不代表 token、美元、延遲或 GPU 時間更少。
- 有沒有 ablation 與重複執行?逐一拿掉記憶、supervisor、tool policy,並報告多次 run 的分布,才知道哪個元件有效。
- 失敗時能不能停、回滾與追責?把 Agent 接到真實系統前,還要有權限邊界、可撤銷動作與完整 ledger;可參考 AlphaLab 的 Agent Runtime Controls 四道閘門。
如果你正在比較兩套 coding agent,最值得先做的不是選一張漂亮 benchmark,而是像 同模型 Harness 盲測協議那樣,釘住 endpoint、題目、工具、預算與評分,再保存完整軌跡。這會比「某次跑出滿分」更接近你真正會得到的系統品質。
接著閱讀
左右滑動查看更多推薦






