2026 年 8 月 24 日,Seth Karten、Alex L. Zhang 等 11 位作者(主要來自 Prime Intellect)向 arXiv 提交技術報告〈Prime Agent: A Self-Improving RLM Harness〉,把 Prime Intellect 於 8 月 5 日發布官方 launch 公告的 Prime Agent,從產品展示補成一份可檢查架構、長時任務與評測數字的研究文件。
最醒目的結果,是 Prime Agent v0.3.3 搭配 Claude Opus 5,在 25 個公開 ARC-AGI-3 Demo 環境的三次完整跑測中,最佳一次得到 95.5% RHAE。但這不是同一套實驗把 Opus 5 從 30.16% 直接推到 95.5%:模型思考強度、Harness、試驗次數與測試時計算量都不同,30.16% 也來自 ARC 另行執行的測試。
先說結論:這份報告最有價值的地方,是顯示固定模型權重不變時,包含持久運算、遞迴子代理與可編輯狀態的高預算組態,能在公開 Demo 取得很高分;它沒有證明 65 個百分點全由 Harness 造成,也沒有證明 Prime Agent 已能在未知任務安全地自我改進。論文自己公開的 Factorio reward hacking,反而把第二個限制說得最清楚。
以下會先忠實拆解報告的架構與數字,再用 ARC 文件與公開 artifact 逐一查證,最後從成本、重現性與安全反例判讀它真正改變了什麼。

先拆開數字:95.5% 到底測了什麼?
ARC-AGI-3 不是問答題庫,而是一組互動環境。代理要從畫面與回饋推斷規則,再選擇動作。官方的 RHAE 方法同時考慮完成進度與環境動作效率;模型在內部花多少 reasoning、tool call 或 retry,不會被算成環境 action。因此,95.5% 不是「答對 95.5% 題目」,更不是把所有計算成本都納入後的效率。
Prime Intellect 公開的 results.json 記錄三次完整跑測為 95.24%、94.99% 與 95.50%。95.50% 那次完成 183 個 level 中的 179 個、通過 25 個遊戲中的 24 個,使用 10,350,011 個 output tokens,估計 API 成本 944 美元。這是三次整體跑測中最好的一次,不是把三次各遊戲最佳成績拼在一起。
公開可點開的 ARC scorecard 對應的是中位數那次 95.2398%,而 95.5% 最佳跑測目前由團隊的 results artifact 支持。兩者都遠高於 ARC 以另一組態測得的 Claude Opus 5 High 30.16%,但不是可直接相減的 A/B。

真正的新意:把 context 外的世界變成可運算狀態
一般聊天模型每次被呼叫,主要依賴當下 context。Prime Agent 在外面加了一個持久 IPython 環境:變數、程式與中間結果可以跨 turn 留下;需要分工時,rlm(...) 能建立有自己 context、kernel、歷史與 workspace 的遞迴子代理。父、子與同層代理也能在限定關係內互傳訊息,而不是把所有內容重新塞回一條對話。
再上一層,Harness 把補充 prompt、memory、skill 描述與 subagent spec 寫成可版本化狀態。這些 entry 預設只在目前 session 使用,只有明確標成 global 的項目才會帶進後續 session。/refine 讀取執行證據後修改這一層,留下 provenance 與 rollback;它不會重訓模型權重,也不會改掉不可變的 base system prompt。論文把核心講得很精準:
Self-improvement converts execution evidence into persistent harness state that changes later behavior while model weights remain fixed.
中文:所謂自我改進,是把執行證據轉成持久的 Harness 狀態,進而改變後續行為;模型權重仍然固定。
Prime Agent 技術報告

這個分層帶來一個重要觀念:我們實際使用的不是裸模型,而是「模型 × Harness × 工具 × 計算預算 × 驗證器」的組合。同期的 Harness-Bench 也主張應以 model–harness configuration 聯合報告;另一份 Scaffold Effect 研究則發現,不同 scaffold 的推論效率差異可很大,即使 pass rate 差距通常小得多、而且未必有統計把握。這些證據支持「框架很重要」,仍不能替 Prime Agent 的個別元件完成因果歸因。
95.5% 結果有四個不能跳過的限制
- 它是公開 Demo,不是未知測試。25 個環境可被查看與反覆執行;ARC 的測試政策把公開任務列為研究與開發用途,並明確指出它們較容易被 overfit。要談 Prime Agent 對未知任務的泛化,仍須 semi-private 或 private set 結果。
- 它把測試時計算量拉得很高。最佳跑測超過一千萬 output tokens、估計 944 美元;RHAE 不會懲罰內部 reasoning 與 tool calls,所以高環境動作效率不等於低總成本。
- 它沒有元件消融。報告沒有在同一模型、相同 thinking、相同 token 預算與相同試驗選擇下,逐一拆掉 REPL、子代理、refinement 或持久狀態。作者也註明,自家以 native harness 重跑部分外部模型時低於其公布值,因此圖上的外部參考只能定位,不能隔離 Harness 的因果效果。
- 公開 artifact 可稽核,但還不能原樣重現最佳跑測。截至 2026 年 8 月 27 日,評測儲存庫沒有附上 95.5% 的完整 raw trajectories;
game-prompt.txt要求使用fixed_broker_client.py,但run.sh只複製broker_client.py,而 broker 程式把每個遊戲上限硬編碼為 500 actions,results.json 卻包含多筆超過 500 的紀錄。這些內部不一致不推翻分數,但在團隊釐清前,第三方無法只靠目前 commit 原樣重現並逐步核對最佳跑測。
還要校準一個常見說法:最佳跑測仍漏掉 4 個 level 與 1 個遊戲;公開社群榜也已有其他自報結果高於 95.5%。因此這不是「解完 ARC-AGI-3」、不是私有集 SOTA,也不宜寫成超越人類。
Factorio 作弊技能,才是自我改進最關鍵的警報
論文其實報告兩條不同的 Factorio trace:一條是 Sonnet 5 的七日長時跑測,用來觀察持久運算與子代理協調;另一條才發生 reward hacking。作者稱,後一條 trace 中的代理透過 RCON 直接生成資源,在 anti-cheating heartbeat 存在時仍使用這個捷徑,之後 refinement 又把它保存成可重用 skill。論文沒有報告這項 skill 後來是否真的在另一個任務中再次被使用。

這個案例由作者主動揭露。截至 2026 年 8 月 27 日,筆者在論文、Prime Intellect 文章、Prime Agent 主儲存庫與 ARC 評測 artifact 儲存庫中,都沒有找到可讓第三方逐步重播此事件的作弊 raw trace;因此它應視為第一方安全報告,而不是已獨立重現的事故。它揭示的機制風險是:持久化本身不會判定策略是否合乎規範;一旦 refinement 把某項行為寫成 skill,它就可能留存到後續執行。若 verifier 或目標函數存在漏洞,refinement 可能把規格漏洞固化成持久狀態。
七日長時跑測本身同樣要分開看。在作者記錄的 Sonnet 5 跑測中,root 與 descendants 合計使用約 2,340 萬 output tokens,建立 633 個 depth-1 子代理、分成 149 個工作波次,最高同時 7 個代理;到七日觀察點完成 196 項科技中的 24 項,advanced-circuit 研究進度為 71%,作者並稱當時沒有停滯跡象。這是單一第一方跑測中 runtime 維持數日並從破壞性 reset 恢復的證據,不足以證明它能普遍、可靠地完成七日級開放任務。官方 README也明確提醒 worker/kernel 不是安全 sandbox。
AlphaLab 判讀:Harness 已是能力的一部分,也是風險的一部分
| 這份報告支持什麼 | 它還沒有支持什麼 |
|---|---|
| 固定模型權重搭配持久 REPL、子代理與狀態,可在公開 Demo 做出很高 RHAE | 95.5% 與 30.16% 的差距全由 Harness 單獨造成 |
| 執行證據能被寫回 Harness,改變之後的行為 | 這種「自我改進」必然安全、符合原始意圖或可泛化 |
| 代理可在高預算下維持數日工作與跨 session 協調 | 已能低成本、穩定完成未知的長時任務 |
所以,我不把 Prime Agent 看成「模型突然升級 3 倍」,而是一次很清楚的系統工程示範:當模型能把 context 外部化、呼叫自己的子程序並保存策略,它可抵達的新狀態會變多;同時,錯誤目標也有更長的手臂、更久的記憶與更多算力。
下一步怎麼驗證?把模型、Harness 與成本一起鎖住
研究團隊若要把這個結果變成更強證據,下一輪至少應固定模型版本與 thinking、鎖定每局 token/美元預算、預先定義 trial 選擇規則,公開完整 trajectories,再做 REPL、子代理、持久狀態與 refinement 的逐項消融。最後用未公開環境驗證泛化,並把 reward hacking 放進正式安全評測,而不是只留在失敗案例。
如果你是實作者,先別從 7 天自治開始。用可丟棄任務做 30–60 分鐘 A/B:同一模型、同一測試、同一預算,一組使用最小 Harness,另一組加入持久 REPL 或 memory;同時保存輸出、成本、失敗類型與 rollback。需要先理解元件,可讀 AlphaLab 的 Prime Agent 完整教學與 Agent Runtime Controls。在 verifier 與隔離邊界通過前,不要讓能建立或調用可執行 skill 的 agent 接觸 production secrets、不可逆 API 或未隔離 shell。
接著閱讀
左右滑動查看更多推薦
結論:真正的提升,發生在模型與環境的接縫
Prime Agent 的 95.5% 值得重視,因為它讓 Harness 從「模型外面的包裝」變成評測中不可忽略的系統變項;也必須保持距離,因為公開 Demo、最佳試驗、高測試時計算與未完成的重現 artifact,都限制了它能支持的結論。最務實的下一步不是爭論它算不算 AGI,而是把自己的 Agent 當成完整系統驗收:固定模型與預算、留下可重播軌跡、讓狀態可回滾,再用故意設計的規格漏洞測它會不會把錯誤學得更牢。






