跳到主要內容

NVIDIA AVO 深度解讀:ARC-AGI-3 公開集 100% 真正證明什麼?(2026)

最後更新: ·
NVIDIA AVO 官方主視覺,搭配「滿分屬於整個系統」封面字樣

2026 年 8 月 21 日,NVIDIA 研究團隊在 Developer Technical Blog 發布了〈NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Purpose Architecture for Long-Horizon Autonomous Agents〉。這篇文章把聚光燈從「又一個更強模型」移到模型外面的系統:NVIDIA 稱它把同一套 NVIDIA AVO 長時程 agent substrate,從連續七天的 GPU kernel 搜尋接到 ARC-AGI-3,搭配 Claude Opus 5 跑完公開示範集的 183 個關卡。

NVIDIA 回報的 100% 有明確範圍,但也最容易被讀錯。它不是 ARC-AGI-3 私有評測滿分,不是 Claude Opus 5 從 30% 被 AVO 單獨拉到 100% 的受控實驗,更不是第一次有人跑完這套公開關卡。真正值得研究的是:當模型、記憶、工具、觀察介面、評分器與恢復機制被組成一個可以長時間運作的閉環,能力會呈現什麼不同的樣子?

NVIDIA Developer 原文頁面,標題說明 AVO 在 ARC-AGI-3 公開集取得 100%
NVIDIA AVO 原文頁面。點擊圖片可在新分頁閱讀完整文章。圖/NVIDIA Developer

下面先忠實拆解 AVO 的運作方式與兩組實驗,再把公開集、私有集、模型基線和跨系統比較逐一對齊,最後回答一個更實用的問題:以後看到「Agent 滿分」,究竟該看模型,還是看 harness?


一、AVO 是什麼?它把一次回答變成持續改進的迴圈

如果把模型比喻成一顆引擎,Agent Harness 就是傳動、儀表、煞車、導航與維修系統。模型負責推理與生成;harness 決定它看到什麼上下文、能用哪些工具、如何保留狀態、何時驗證、失敗後怎麼回復,以及工作能不能跨過一次 context window 繼續下去。

“The model matters, but the model is not the entire agent.”

中文:「模型很重要,但模型並不是整個 Agent。」

— NVIDIA AVO 研究文章

NVIDIA AVO(Agentic Variation Operators)把一般 coding agent 放進一個反覆運轉的搜尋流程:先讀取既有候選、分數、文件和程式碼,接著規劃、實作、執行評測、診斷失敗,再決定下一個修改方向。只有通過正確性檢查、表現不退步的候選才進入已接受的 lineage;失敗嘗試則成為下一輪推理的材料。

NVIDIA AVO 架構圖,輸入包含候選、知識庫與評分器,中間由 Agent 反覆檢查、規劃、實作、評估與修復,右側由 supervisor 監測進度
AVO 的核心不是一個新模型,而是「檢查 → 規劃 → 實作 → 評估 → 修復」的長時間迴圈,加上持久記憶、工具與 supervisor。圖/NVIDIA

兩個機制特別關鍵。第一是持久記憶:先前版本、編譯器錯誤、profiler 結果與推理脈絡不必每輪重建。第二是supervisor:當搜尋停滯或反覆繞圈時,另一層監督機制可以把主 agent 導向替代方向。AVO 論文把它描述為 self-supervision,並稱七天 kernel 搜尋過程沒有人工逐步介入;這裡的「自主」指的是人類先設計好知識庫、工具、評分函數與邊界後,系統自行走完迭代,而不是沒有任何人類工程。

這個迴圈不是憑空出現:ReAct 早已把推理與外部行動交錯,Reflexion 把環境回饋寫進 episodic memory,Voyager 也展示了工具、記憶與自我驗證支撐的長期探索。AVO 較有辨識度的貢獻,不是發明「回饋+記憶」,而是把自我導向的 coding agent 放到 evolutionary search 的 variation operator 位置,並用七天 B200 實驗展示它能持續工作。

二、七天 GPU kernel 搜尋:AVO 最扎實、也最受限的證據

NVIDIA 在 2026 年 3 月上傳的 AVO 論文,先把這套方法用在 Blackwell B200 的 attention kernel 最佳化。作者回報 AVO 連續運轉七天、探索超過 500 個最佳化方向,最後留下 40 個已提交版本。測試環境是 NVIDIA B200、CUDA 13.1、PyTorch 2.10.0;基準包含 cuDNN 9.19.1 與固定在 2026 年 3 月版本(commit 71bf77c)的 FlashAttention-4,並沿用 FA4 timing script,重複量測十次取平均與標準差。

最亮眼的「快 10.5%」有明確邊界:最高值出現在 BF16、head dimension 128、16-head、forward prefilling、因果遮罩 MHA、4K sequence/batch 8 這一格。四組因果遮罩設定中,相對 cuDNN 的增幅範圍是 0.4%–3.5%,相對當時固定版本的 FA4 是 5.0%–10.5%;這不是目前 FA4、所有 attention workload 或整體模型推論的普遍加速。在非因果遮罩、較短序列的設定,論文則說差距落在量測雜訊內。後續把 MHA kernel 改成兩種 Qwen3 型 GQA 配置,作者稱約 30 分鐘完成,最高分別領先 cuDNN 7.0%、FA4 9.3%。

這組實驗比「agent 寫出一段看起來能跑的 code」更有說服力,因為依論文流程,每次修改都要通過內部數值正確性和實機 throughput 評測;未通過正確性檢查的候選得零分,退步版本不會被接受。它支持 AVO 至少能在一個目標清楚、回饋快速、評分可機械驗證的工程空間裡,把數百次嘗試累積成有效進展。

但它仍是 NVIDIA 團隊對自家 B200 實驗的報告,不應外推成「所有 workload 都快 10.5%」。論文本身也提醒,公開的 trajectory 只呈現 40 個成功提交,並不是 500 多個內部方向的完整搜尋樹。最合理的讀法是:AVO 展示了一個值得重現的長期最佳化方法;10.5% 是特定配置下的最高值,不是普遍保證。

三、ARC-AGI-3 的 100%:完成了什麼,又沒有完成什麼?

ARC-AGI-3 把傳統靜態問答改成互動式遊戲。Agent 一開始不知道規則、目標或物件用途,只能選擇動作、觀察環境改變、建立假設,再把學到的機制帶進後續關卡。RHAE(Relative Human Action Efficiency)同時計算完成度與相對首次人類玩家的動作效率;要注意的是,只有環境動作進入這個分數,內部推理、讀取記憶或檢查畫面不算 action,也不是成本或延遲指標。每關效率分最高可到 115,整體 game score 再以完成度封頂 100,因此總分 100 不等於每一關都零失誤或每一步都比人類快;但 AVO 確實回報完成了全部 183 關。

NVIDIA 公布的 ARC-AGI-3 公開示範集結果畫面,25 個環境全部打勾,顯示完成 183 個關卡
NVIDIA 回報 AVO 搭配 Claude Opus 5 完成 ARC-AGI-3 公開示範集 25 個環境、183 個關卡。這不是半私有或全私有評測結果。圖/NVIDIA

NVIDIA 回報的結果是 25 個公開環境全破、183/183 關、100.00 RHAE,共使用 6,624 個 scored environment actions。這些數字採用 ARC 的官方計分格式,但本文仍按「NVIDIA 回報」處理,不把 official scorecard 格式誤寫成 ARC Prize 獨立驗證。文章選擇和 MIT 團隊的 VISTA 比較:VISTA 也以 Claude Opus 5 完成同一批 183 關,回報 7,542 個動作;依兩邊公布的總數計算,AVO 少約 12.2%。

不過,這不是當時最接近的已公開結果。Tycho 論文在 7 月底已回報同樣以 Claude Opus 5 跑完 183 關、100.00 RHAE,共 6,641 個 scored actions。若兩邊的 action 計數口徑可比,AVO 的 6,624 只少 17 個,約 0.26%。VISTA 的 12.2% 對照數學上成立,但 Tycho 的 17 步差距是更接近的同時期參考。

“This should not be interpreted as a controlled ablation.”

中文:「這不應被解讀成受控的消融實驗。」

— NVIDIA AVO 研究文章

這句但書比 12% 本身更重要。VISTA 主要把 64×64 狀態放大成 512×512 PNG 給多模態模型看,並公開使用 Opus 5 xhigh;AVO 則傳入精確的 64×64 純文字 grid,但沒有揭露可一對一核對的確切 reasoning effort。兩邊的 agent backend、記憶、context 管理與其他實作細節也不同。所以 6,624 對 7,542 只能說「兩套完整系統的已回報結果不同」,不能單獨歸因給 AVO 的持久記憶或 supervisor。

文字 grid 序列化、ARC 專用工具與 evaluator 也不是無關痛癢的接線:它們會改變模型看到的問題與可採取的動作。更準確的說法是,NVIDIA 把既有長時程 substrate 接上新的 task adapter,而不是拿完全相同的設定做盲測。要證明核心架構真正 transfer,還需要公開哪些模組完全不變、adapter 改了什麼,以及在開發者未見的環境上一次性測試。

同樣地,ARC Prize 在 2026 年 7 月 24 日公布的 Claude Opus 5 High Verified 分數 30.16%來自 55 個 semi-private 環境;AVO 的 100 則來自 25 個 open Public Demo,NVIDIA 也明確說 reasoning setting、agent system 與 evaluation setup 不同。把 30.16% 和 100% 相減,不能得到「AVO 貢獻 69.84 個百分點」。要量出架構本身的貢獻,至少要在同一批環境固定模型、推理強度、觀察格式、工具與預算,再逐一拿掉記憶、supervisor 或 context 策略重跑。

目前公開的 NVIDIA 文章與所連論文,也沒有提供這次 ARC run 的確切模型 snapshot/effort/sampling、attempt 與 restart 規則、best-of-N 或失敗 run 計法、memory 跨關或跨遊戲範圍、supervisor 身分與觸發條件、ARC run 是否有人介入、完整 prompt/tool schema、GPU 版與 ARC 版 config diff,以及可公開核算的 scorecard ID 與 replay。這些缺口不會自動推翻 6,624,但會讓「架構完全相同」「runtime 全自主」與「可獨立重現」仍停留在待驗證。VISTA 團隊還提醒:Opus 5 在公開遊戲之後推出,不能排除模型訓練資料曾接觸公開題或 replay;同一個 caveat 也適用於 AVO。

四、公開滿分不是私有評測,更不是 AGI 成績

ARC-AGI-3 技術報告把資料分成 25 個 Public Demo、55 個 Semi-Private 與 55 個 Fully Private 環境。報告把公開集定位為讓人理解格式與基本機制的「front door」,把 private set 定位為分布與公開機制不同、用來更嚴格測試泛化的 holdout。無論不同版本的難度如何變動,最關鍵的邊界都不變:公開題已曝光,semi-private 與 fully private 才是未公開評測。

ARC Prize 的立場甚至更直接:因為公開環境可以被反覆看見、針對性調整,官方 leaderboard 不會用公開集分數衡量 AGI 進展。ARC 的 Community Leaderboard 也提醒,ARC-AGI-3 公開集分數原則上是 self-reported;它列出 Tycho 在 7 月 29 日回報 100.0%。VISTA 則在自己的專案頁於 8 月 5 日發布完整 25-game 滿分結果。NVIDIA 的 8 月 21 日成果因此不是第一個公開集滿分。更關鍵的是,Tycho 的 executable world model、VISTA 的極簡 visual harness 與 AVO 的文字 grid 加持久記憶都能到頂,代表公開集已出現「多條不同路徑同時飽和」;單看 100 分,已很難辨認哪個架構元件才是原因。

這不會讓 AVO 失去價值,卻會收窄它能支持的命題。目前材料最多支持:NVIDIA 所描述的完整 AVO 系統,在已公開的 25 個環境裡回報完成所有關卡,並回報比 VISTA 少的環境動作。它尚未證明同一套配置能在 110 個未公開環境維持優勢,也沒有把「跨兩個任務可運作」直接升格成廣義通用智能。

五、真正的新訊號:模型分數不等於完整 Agent 表現

AVO 最有意思的地方,不是把一張榜單塗成綠色,而是把兩個表面完全不同的工作化成同一個計算模式:

  • GPU kernel:提出最佳化假設、改 code、跑 correctness 與 profiler、保留有效版本、從錯誤修正。
  • ARC-AGI-3:猜測世界規則、採取動作、觀察結果、保留已學機制、推翻錯誤假設。

兩者共同依賴的不是特定領域答案,而是「假設 → 行動 → 可驗證回饋 → 記憶 → 修復」的閉環。這也是為什麼單看模型 benchmark 會逐漸不夠:同一顆模型放進不同的觀察格式、工具權限、memory policy、停止條件和 evaluator,最後表現可能像不同產品。

但「harness 很重要」不等於「harness 比模型重要」。沒有 Claude Opus 5 的底層能力,AVO 未必能形成高品質假設;沒有 harness,那些能力又很難跨數千次互動穩定累積。兩者是乘法關係,任一項接近零,整體都會崩掉。AVO 的材料支持「模型不是全部」,還不足以替模型與 harness 排出一個普遍順位。

六、我同意什麼;我對什麼仍然保留

我同意 NVIDIA 的核心方向:長時間 Agent 應該以完整系統評估。能否保留狀態、使用真實工具、接受外部回饋、辨識停滯與從錯誤恢復,確實決定模型能力能不能累積。相較一次性的 demo,七天 kernel 搜尋尤其接近真實工程價值,因為正確性與速度都可被機器檢查。

我對三個跳躍仍然保留:第一,30.16%→100% 不是 AVO 的淨貢獻;第二,公開集滿分不能代表未見環境的泛化;第三,跨 kernel 與公開遊戲兩個場景,仍不足以確認「general-purpose」能延伸到模糊目標、慢速回饋或錯誤評分器的現實工作。當 evaluator 很可靠時,agent 可以高速爬山;當「做對」本身難以定義時,記憶也可能把錯誤方向保存得更久。

我也不會把它直接當成 production-ready 證據。本文檢視的 NVIDIA 材料沒有報告 ARC 的 token/API cost/wall-clock、kernel 搜尋使用幾張 B200、多少 GPU-hours 或 agent inference 成本,也沒有交代 sandbox、network egress、credential scope、audit log、kill switch 與 rollback 控制。這些營運與安全缺口不會改寫 benchmark 分數,卻會阻止我們從一個研究環境直接推導 ROI、可靠性或上線安全。

所以我的結論不是把 AVO 降格成行銷,也不是把它捧成通用智能。它是一個強而有邊界的訊號:前沿模型的下一段進步,很可能不只來自下一次權重更新,也來自讓推理、工具、回饋與狀態在時間上累積的工程。真正的考驗,會是固定條件的消融實驗、未見環境成績、重複執行的變異、成本與延遲,以及其他團隊能否得到相近結果。

七、看到下一個「Agent 滿分」,先問這六個問題

  1. 考的是公開題還是 holdout?公開題適合開發,私有題才比較接近泛化。
  2. 比較時模型與 reasoning effort 有沒有固定?不固定,就無法把差異歸因給 harness。
  3. 觀察格式、工具與預算是否相同?PNG、文字 grid、額外讀取和內部推理成本都會改變結果。
  4. 分數計算了什麼、漏掉什麼?環境 action 少,不代表 token、美元、延遲或 GPU 時間更少。
  5. 有沒有 ablation 與重複執行?逐一拿掉記憶、supervisor、tool policy,並報告多次 run 的分布,才知道哪個元件有效。
  6. 失敗時能不能停、回滾與追責?把 Agent 接到真實系統前,還要有權限邊界、可撤銷動作與完整 ledger;可參考 AlphaLab 的 Agent Runtime Controls 四道閘門

如果你正在比較兩套 coding agent,最值得先做的不是選一張漂亮 benchmark,而是像 同模型 Harness 盲測協議那樣,釘住 endpoint、題目、工具、預算與評分,再保存完整軌跡。這會比「某次跑出滿分」更接近你真正會得到的系統品質。

接著閱讀

左右滑動查看更多推薦

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。