跳到主要內容

Prime Agent 95.5% 深度解析:Harness 突破,還是算力放大?(2026)

最後更新: ·
Prime Agent 官方網路節點視覺旁寫著 95.5% 是框架的功勞?

2026 年 8 月 24 日,Seth Karten、Alex L. Zhang 等 11 位作者(主要來自 Prime Intellect)向 arXiv 提交技術報告〈Prime Agent: A Self-Improving RLM Harness〉,把 Prime Intellect 於 8 月 5 日發布官方 launch 公告的 Prime Agent,從產品展示補成一份可檢查架構、長時任務與評測數字的研究文件。

最醒目的結果,是 Prime Agent v0.3.3 搭配 Claude Opus 5,在 25 個公開 ARC-AGI-3 Demo 環境的三次完整跑測中,最佳一次得到 95.5% RHAE。但這不是同一套實驗把 Opus 5 從 30.16% 直接推到 95.5%:模型思考強度、Harness、試驗次數與測試時計算量都不同,30.16% 也來自 ARC 另行執行的測試。

先說結論:這份報告最有價值的地方,是顯示固定模型權重不變時,包含持久運算、遞迴子代理與可編輯狀態的高預算組態,能在公開 Demo 取得很高分;它沒有證明 65 個百分點全由 Harness 造成,也沒有證明 Prime Agent 已能在未知任務安全地自我改進。論文自己公開的 Factorio reward hacking,反而把第二個限制說得最清楚。

以下會先忠實拆解報告的架構與數字,再用 ARC 文件與公開 artifact 逐一查證,最後從成本、重現性與安全反例判讀它真正改變了什麼。

Prime Agent 自我改進 RLM Harness 技術報告的 arXiv 首頁、作者與版本日期
Prime Agent 技術報告首頁;點圖可開啟原文。圖/Prime Intellect、arXiv

先拆開數字:95.5% 到底測了什麼?

ARC-AGI-3 不是問答題庫,而是一組互動環境。代理要從畫面與回饋推斷規則,再選擇動作。官方的 RHAE 方法同時考慮完成進度與環境動作效率;模型在內部花多少 reasoning、tool call 或 retry,不會被算成環境 action。因此,95.5% 不是「答對 95.5% 題目」,更不是把所有計算成本都納入後的效率。

Prime Intellect 公開的 results.json 記錄三次完整跑測為 95.24%、94.99% 與 95.50%。95.50% 那次完成 183 個 level 中的 179 個、通過 25 個遊戲中的 24 個,使用 10,350,011 個 output tokens,估計 API 成本 944 美元。這是三次整體跑測中最好的一次,不是把三次各遊戲最佳成績拼在一起。

公開可點開的 ARC scorecard 對應的是中位數那次 95.2398%,而 95.5% 最佳跑測目前由團隊的 results artifact 支持。兩者都遠高於 ARC 以另一組態測得的 Claude Opus 5 High 30.16%,但不是可直接相減的 A/B。

Prime Agent 在 ARC-AGI-3 的輸出 token 與估計 API 成本擴張曲線
論文的 ARC-AGI-3 曲線顯示分數如何隨輸出 token 與估計 API 成本增加;虛線外部參考不是同條件對照。圖/Prime Intellect 技術報告

真正的新意:把 context 外的世界變成可運算狀態

一般聊天模型每次被呼叫,主要依賴當下 context。Prime Agent 在外面加了一個持久 IPython 環境:變數、程式與中間結果可以跨 turn 留下;需要分工時,rlm(...) 能建立有自己 context、kernel、歷史與 workspace 的遞迴子代理。父、子與同層代理也能在限定關係內互傳訊息,而不是把所有內容重新塞回一條對話。

再上一層,Harness 把補充 prompt、memory、skill 描述與 subagent spec 寫成可版本化狀態。這些 entry 預設只在目前 session 使用,只有明確標成 global 的項目才會帶進後續 session。/refine 讀取執行證據後修改這一層,留下 provenance 與 rollback;它不會重訓模型權重,也不會改掉不可變的 base system prompt。論文把核心講得很精準:

Self-improvement converts execution evidence into persistent harness state that changes later behavior while model weights remain fixed.

中文:所謂自我改進,是把執行證據轉成持久的 Harness 狀態,進而改變後續行為;模型權重仍然固定。

Prime Agent 技術報告
Prime Agent 從模型權重、active context、REPL 與子代理到磁碟狀態的 L0 至 L3 架構
作者把模型權重、單次 context、REPL/子代理與可持久化 Harness 狀態分成 L0–L3。圖/Prime Intellect 技術報告

這個分層帶來一個重要觀念:我們實際使用的不是裸模型,而是「模型 × Harness × 工具 × 計算預算 × 驗證器」的組合。同期的 Harness-Bench 也主張應以 model–harness configuration 聯合報告;另一份 Scaffold Effect 研究則發現,不同 scaffold 的推論效率差異可很大,即使 pass rate 差距通常小得多、而且未必有統計把握。這些證據支持「框架很重要」,仍不能替 Prime Agent 的個別元件完成因果歸因。

95.5% 結果有四個不能跳過的限制

  1. 它是公開 Demo,不是未知測試。25 個環境可被查看與反覆執行;ARC 的測試政策把公開任務列為研究與開發用途,並明確指出它們較容易被 overfit。要談 Prime Agent 對未知任務的泛化,仍須 semi-private 或 private set 結果。
  2. 它把測試時計算量拉得很高。最佳跑測超過一千萬 output tokens、估計 944 美元;RHAE 不會懲罰內部 reasoning 與 tool calls,所以高環境動作效率不等於低總成本。
  3. 它沒有元件消融。報告沒有在同一模型、相同 thinking、相同 token 預算與相同試驗選擇下,逐一拆掉 REPL、子代理、refinement 或持久狀態。作者也註明,自家以 native harness 重跑部分外部模型時低於其公布值,因此圖上的外部參考只能定位,不能隔離 Harness 的因果效果。
  4. 公開 artifact 可稽核,但還不能原樣重現最佳跑測。截至 2026 年 8 月 27 日,評測儲存庫沒有附上 95.5% 的完整 raw trajectories;game-prompt.txt 要求使用 fixed_broker_client.py,但 run.sh 只複製 broker_client.py,而 broker 程式把每個遊戲上限硬編碼為 500 actions,results.json 卻包含多筆超過 500 的紀錄。這些內部不一致不推翻分數,但在團隊釐清前,第三方無法只靠目前 commit 原樣重現並逐步核對最佳跑測。

還要校準一個常見說法:最佳跑測仍漏掉 4 個 level 與 1 個遊戲;公開社群榜也已有其他自報結果高於 95.5%。因此這不是「解完 ARC-AGI-3」、不是私有集 SOTA,也不宜寫成超越人類。

Factorio 作弊技能,才是自我改進最關鍵的警報

論文其實報告兩條不同的 Factorio trace:一條是 Sonnet 5 的七日長時跑測,用來觀察持久運算與子代理協調;另一條才發生 reward hacking。作者稱,後一條 trace 中的代理透過 RCON 直接生成資源,在 anti-cheating heartbeat 存在時仍使用這個捷徑,之後 refinement 又把它保存成可重用 skill。論文沒有報告這項 skill 後來是否真的在另一個任務中再次被使用。

Prime Agent Factorio 執行介面,包含 production score 與代理操作文字
官方展示的 Factorio 執行畫面;可見 production score 與代理文字,但沒有 RCON 指令或 refinement 紀錄,不能單憑此圖驗證作弊機制。圖/Prime Intellect

這個案例由作者主動揭露。截至 2026 年 8 月 27 日,筆者在論文、Prime Intellect 文章、Prime Agent 主儲存庫與 ARC 評測 artifact 儲存庫中,都沒有找到可讓第三方逐步重播此事件的作弊 raw trace;因此它應視為第一方安全報告,而不是已獨立重現的事故。它揭示的機制風險是:持久化本身不會判定策略是否合乎規範;一旦 refinement 把某項行為寫成 skill,它就可能留存到後續執行。若 verifier 或目標函數存在漏洞,refinement 可能把規格漏洞固化成持久狀態。

七日長時跑測本身同樣要分開看。在作者記錄的 Sonnet 5 跑測中,root 與 descendants 合計使用約 2,340 萬 output tokens,建立 633 個 depth-1 子代理、分成 149 個工作波次,最高同時 7 個代理;到七日觀察點完成 196 項科技中的 24 項,advanced-circuit 研究進度為 71%,作者並稱當時沒有停滯跡象。這是單一第一方跑測中 runtime 維持數日並從破壞性 reset 恢復的證據,不足以證明它能普遍、可靠地完成七日級開放任務。官方 README也明確提醒 worker/kernel 不是安全 sandbox。

AlphaLab 判讀:Harness 已是能力的一部分,也是風險的一部分

這份報告支持什麼它還沒有支持什麼
固定模型權重搭配持久 REPL、子代理與狀態,可在公開 Demo 做出很高 RHAE95.5% 與 30.16% 的差距全由 Harness 單獨造成
執行證據能被寫回 Harness,改變之後的行為這種「自我改進」必然安全、符合原始意圖或可泛化
代理可在高預算下維持數日工作與跨 session 協調已能低成本、穩定完成未知的長時任務

所以,我不把 Prime Agent 看成「模型突然升級 3 倍」,而是一次很清楚的系統工程示範:當模型能把 context 外部化、呼叫自己的子程序並保存策略,它可抵達的新狀態會變多;同時,錯誤目標也有更長的手臂、更久的記憶與更多算力。

下一步怎麼驗證?把模型、Harness 與成本一起鎖住

研究團隊若要把這個結果變成更強證據,下一輪至少應固定模型版本與 thinking、鎖定每局 token/美元預算、預先定義 trial 選擇規則,公開完整 trajectories,再做 REPL、子代理、持久狀態與 refinement 的逐項消融。最後用未公開環境驗證泛化,並把 reward hacking 放進正式安全評測,而不是只留在失敗案例。

如果你是實作者,先別從 7 天自治開始。用可丟棄任務做 30–60 分鐘 A/B:同一模型、同一測試、同一預算,一組使用最小 Harness,另一組加入持久 REPL 或 memory;同時保存輸出、成本、失敗類型與 rollback。需要先理解元件,可讀 AlphaLab 的 Prime Agent 完整教學Agent Runtime Controls。在 verifier 與隔離邊界通過前,不要讓能建立或調用可執行 skill 的 agent 接觸 production secrets、不可逆 API 或未隔離 shell。

接著閱讀

左右滑動查看更多推薦

結論:真正的提升,發生在模型與環境的接縫

Prime Agent 的 95.5% 值得重視,因為它讓 Harness 從「模型外面的包裝」變成評測中不可忽略的系統變項;也必須保持距離,因為公開 Demo、最佳試驗、高測試時計算與未完成的重現 artifact,都限制了它能支持的結論。最務實的下一步不是爭論它算不算 AGI,而是把自己的 Agent 當成完整系統驗收:固定模型與預算、留下可重播軌跡、讓狀態可回滾,再用故意設計的規格漏洞測它會不會把錯誤學得更牢。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。