跳到主要內容

AgentOPSD 是什麼?遞迴信用分配能找出 Agent 關鍵步驟嗎?(2026)

最後更新: ·
AgentOPSD:哪一步有功?遞迴信用分配研究

2026 年 8 月 6 日,清華大學、浙江大學與美團等機構的研究團隊在 arXiv 發布預印本〈AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning〉。AgentOPSD 想解決多步 AI Agent 訓練最難纏的一件事:一條軌跡最後成功或失敗,這個單一結果究竟該算在哪一輪行動頭上?它不另外訓練 critic,也不增加 rollout,而是比較同一模型在「看得到訓練期技能提示」與「看不到技能提示」時,對實際生成 token 給出的對數機率差,再把差異遞迴累積成每輪的信用權重。

論文很快取得研究社群注意。截至 2026 年 8 月 9 日 20:26(台北時間),Hugging Face Papers 顯示它是 8 月 7 日每日榜第 1 名、79 upvotes;alphaXiv 顯示 354 views、36 likes,官方 GitHub repo 約 19 stars。這些是注意力訊號,不是方法已被重現的證據;尤其 repo 目前還沒有訓練程式碼,這點和「code available」的第一印象不同。

先把原始論文放在桌上。點擊下面的瀏覽器畫面會開啟 arXiv;接下來我會用白話拆開 teacher/student gap、遞迴 belief 與 GRPO advantage 的關係,再檢查 89.1% 到底證明了什麼、沒有證明什麼,最後給出這個方法真正值得延伸的方向。

AgentOPSD arXiv 論文頁瀏覽器畫面,點擊可閱讀原始預印本
AgentOPSD 原始預印本;點擊圖片可前往 arXiv 閱讀。圖/arXiv

一、最後拿到 1 分,為什麼還是不知道哪一步有功?

想像一個家務 Agent 接到「把洗過的蘋果放進冰箱」:它先找蘋果、走到水槽、清洗、打開冰箱、放進去。環境只在結尾回傳成功 1、失敗 0。標準 GRPO 會對同一題採樣一組完整軌跡,再用每條軌跡相對於組內平均的結果,算出一個 sequence-level advantage;問題是同一條軌跡裡的每個 token、每一輪行動,都繼承同一個 advantage。

因此,一條成功軌跡裡即使有繞路、重複觀察或碰巧沒造成傷害的壞動作,也會一起被鼓勵;失敗軌跡中先前正確的找物與清洗步驟,也會一起被壓低。互動越長,「最後結果」與「局部決策」之間的距離就越大。這就是 delayed reward 下的 credit assignment 問題。

最理想的解法,是對第 k 輪做反事實實驗:把這個動作換掉,沿著所有可能的後續分支重跑,看看成功率改變多少。但長軌跡的 continuation 幾乎爆炸成無法窮舉的樹。AgentOPSD 因而不直接估計因果貢獻,而是尋找一個可計算的 hindsight proxy。


二、核心機制:讓「帶技能的自己」替「沒帶技能的自己」打分

這裡的 teacher 不是另一個更大模型。teacher 與 student 共用相同參數,也評分同一段由 student 實際生成的 action;差別只有 teacher 在訓練時額外看到一段從 SkillBank 檢索出的有用技能 c+,student 看不到。對每個已生成 token,方法計算以下白話簡寫:

δ = log p(token|狀態、技能) − log p(token|狀態)

如果帶技能的分支比普通分支更認同這個 token,δ 就是正值。把同一輪 action 的所有 token gap 相加,得到 turn evidence eₖ。論文對它的定位其實相當克制:

“We therefore treat ek as a tractable Bayesian-inspired evidence proxy.”

中文:「因此,我們把 ek 視為一個可計算、受貝葉斯啟發的證據代理值。」

AgentOPSD §2.2

關鍵字是 proxy。作者假設「帶有成功相關技能的分支」近似成功行為分布,而普通分支近似背景行為分布;若要再把普通分支近似成失敗行為,還需要成功率很低、普通分支主要由失敗軌跡支配。這些條件成立時,兩者的 likelihood ratio 才能被當成一個動作對成功的相對證據;否則它更接近 skill context 與 action 的 PMI-like evidence。這不是直接觀測到「若改做另一個動作,結果就會改變多少」。

AgentOPSD 方法圖,顯示 token 機率差聚合為 turn evidence,再遞迴更新 belief 並重塑 GRPO advantage
同參數 self-teacher 以訓練期技能重新評分 student action;token gap 先聚合成每輪證據,再經 belief revision 重塑原本的 GRPO advantage。圖/AgentOPSD arXiv v1

三、為什麼還要遞迴?同一句好指令,在不同歷史裡價值不同

只看當輪 eₖ,仍然不知道這個訊號是關鍵轉折,還是前面早已確立方向後的重複資訊。AgentOPSD 先把同題 8 條 rollout 的 clipped empirical success rate 當成 group-rate anchor B₀,而不是獨立估計、經校準的 Bayesian prior,再用衰減係數 γ 遞迴累積證據:

  • cₖ = γcₖ₋₁ + eₖ:保留歷史,但讓舊證據逐步衰減。
  • Bₖ = sigmoid(logit(B₀) + cₖ):把累積證據映射到 0–1 的相對支持狀態。
  • ΔBₖ = Bₖ − Bₖ₋₁:量測這個 turn boundary 前後的狀態 revision,作為邊際信用代理。

這個設計有兩個直覺。第一,當支持度接近中間、結果仍不確定時,新證據容易造成較大變化;當狀態已飽和,再來一個同方向動作就比較像重複確認。第二,遞迴保留了順序:完全相同的 local gap,出現在第一輪與第十輪,不一定獲得相同權重。

ΔBₖ 不是純粹隔離出的「本輪貢獻」。作者預設 γ=0.95 時,log-odds 的增量其實是 eₖ − 0.05cₖ₋₁;即使本輪 eₖ=0,舊證據衰減也可能造成負 revision。嚴格的 sequential likelihood accumulation 對應 γ=1,預設版本更像 recency-weighted heuristic:它讓訊號成為 history-aware state change,卻也再次說明不能把數值直接當成 action 的因果效果。

“Bk is treated as relative support rather than a calibrated success probability.”

中文:「Bk 被視為相對支持度,而不是經過校準的成功機率。」

AgentOPSD §2.3

所以把 Bₖ=0.8 解讀成「這時有 80% 成功率」會超出論文主張。研究沒有做 belief calibration,也沒有用人工標註的 pivotal turns 或 action replacement,去驗證最高分的輪次真的最有因果貢獻。


四、它不是替每一步發新獎金,而是有限度地調音量

拿到 ΔBₖ 後,AgentOPSD 會先依最終成功/失敗的 GRPO advantage 對齊方向,再在單一軌跡內標準化,形成 bounded multiplier wₖ。最後每一輪仍以原本的 sequence advantage 為底,只改變幅度:

Ãₖ = Aseq × [(1 − λ) + λwₖ]

作者預設 λ=0.5、band b=0.2,因此 wₖ 被夾在 0.8–1.2,最終乘數只會落在 0.9–1.1。它永遠是正數,不會翻轉 shaped advantage 的正負:成功軌跡中的壞步驟仍繼承同號 advantage,只是幅度可能較小;失敗軌跡中的好步驟也仍繼承同號 advantage,不能被改造成相反方向的 reward signal。PPO clipping 仍可能讓個別 token 的實際 policy-gradient 歸零。

訊號它真正表示什麼不能把它當成什麼
最終 reward整條軌跡成功或失敗每輪獨立正確答案
teacher–student gap eₖ技能 context 對實際 action likelihood 的影響換掉 action 後的因果效果
belief revision ΔBₖ當輪對歷史累積支持度的邊際改變校準成功率
shaped advantage Ãₖ原 GRPO 更新的 0.9–1.1 倍重加權可獨立翻正/翻負的 turn reward

這條安全欄讓方法較不容易被 noisy proxy 帶到反方向,但也保留 GRPO 的 zero-variance 盲點:如果同題 8 條 rollout 全部失敗或全部成功,組內 advantage 是 0,AgentOPSD 乘完仍是 0;再漂亮的 turn evidence 也不會替該 group 產生 verifier-driven policy-gradient 或 credit-shaping signal,只剩 KL/entropy regularization 仍可能更新參數。全敗時這會形成冷啟動問題;全對時則沒有相對學習訊號。它改善「有結果差異時怎麼分配」,沒有解決「整組沒有結果差異時怎麼得到任務訊號」。


五、89.1% 怎麼來的?先看完整比較,不看單一冠軍數字

作者在 Qwen2.5-3B-Instruct 與 Qwen2.5-7B-Instruct 上,以 ALFWorld、Search-QA、WebShop 三個互動環境比較 GRPO 與多種 self-distillation baseline。最吸睛的 89.1%,是 Qwen2.5-7B 在 ALFWorld 的 aggregate success rate;它比 GRPO 的 81.2% 高 7.9 個百分點,但只比同為 turn-level 的 StepOPSD 88.4% 高 0.7 個百分點。

Qwen2.5-7B 評測GRPO較強鄰近 baselineAgentOPSD正確解讀
ALFWorld success81.2%StepOPSD 88.4%89.1%主要亮點,但相對最接近方法只多 0.7 點
Search-QA accuracy42.0%SDAR/RLSD 49.0%49.2%只多 0.2 點
WebShop score80.9SDAR 89.490.2partial completion score 最佳
WebShop exact success72.6%SDAR 82.8%79.7%不是所有主要指標都贏
數字均為作者在 arXiv v1 Table 1 報告的 point estimates;不是 AlphaLab 的獨立重跑。

3B 結果也提醒我們別寫成「全面領先」:AgentOPSD 在 ALFWorld 是 84.4%,與 SDAR 並列;作者的八組 aggregate comparisons 中,AgentOPSD 超過 SDAR 六組,不是八組全勝。方法內 ablation 提供了另一層線索:在 7B ALFWorld,完整方法 89.1%,改成 per-token accumulation 為 85.9%,直接用 raw local gap 為 82.8%,拿掉 outcome-aligned sign 為 80.5%,拿掉成功率 prior 為 78.9%。這組單次 point estimates 與各元件在該設定下有效的解釋一致,但沒有 multi-seed 或顯著性證據。

AgentOPSD 訓練動態圖,包含 ALFWorld 驗證成功率、六類任務的回合長度回歸與 policy entropy
作者的 7B ALFWorld 訓練動態。中圖的 −0.54 斜率,是六個任務類別的 success point 對成功 episode 平均 turns 所做描述性 OLS,不是控制變因後把同一任務逐步拉長的實驗。圖/AgentOPSD arXiv v1

證據強度仍有限。AlphaLab 檢視 8 月 6 日的 arXiv v1 正文與附錄,表格只列 point estimates,沒有 multi-seed 平均、信賴區間或顯著性檢定;ablation 集中在單一 7B ALFWorld 設定。論文自述 WebShop 沿用 128 個固定 validation tasks,但確切 subset provenance 要等程式碼確認;它也沒有列出 ALFWorld evaluation split/task count 與 Search-QA 各 dataset 的 eval count,而 Search-QA 互動上限是 4 turns。這三個 benchmark 都不是帶有即時 API 變化、權限、安全攻擊與非平穩狀態的 production agent 實地測試。89.1% 因而是值得重現的研究結果,不是「Agent 已有 89.1% 生產可靠度」。


六、為什麼大家興奮?它把 dense signal 接回既有 GRPO

AgentOPSD 最吸引人的地方,不是宣稱找到完美 reward,而是工程上相對節制:不訓練額外 critic、不用為每一步增加 sibling rollout,也沒有在推理時保留 SkillBank;teacher signal 只在訓練中重新評分已生成 action,再把 dense evidence 接回既有的 clipped GRPO objective。它仍依賴由 teacher model 從軌跡整理出的 SkillBank supervision pipeline,所以「沒有額外 critic」不等於「沒有額外 supervision」。對已經有 outcome verifier 與 skill retrieval 的團隊,這條路看起來比另建 value model 更容易插入。

但「沒有額外 critic/rollout」不等於免費。論文 Algorithm 1 以每輪一次額外 teacher forward 描述數學流程,附錄 cost 段落則寫每條 trajectory 一次;這可能代表實作能把多輪合併成一次 batched trajectory scoring,也可能只是文字粒度不同。論文沒有報告 wall-clock、GPU 記憶體或總訓練成本。安全的結論只能是:它避免了 learned critic 與新增環境 rollout,但仍有 teacher re-scoring 成本,實際 overhead 尚待程式碼與 profiling 釐清。

另一個需要當場修正的興奮點是「公開程式碼」。截至本文查核時間,官方 repo 只有 README、LICENSE 與 .gitignore,README 明寫:

“Code coming soon. The full training code and scripts will be released here shortly.”

中文:「程式碼即將推出,完整訓練程式與腳本稍後才會釋出。」

AgentOPSD GitHub README
AgentOPSD 官方 GitHub README 截圖,顯示 Code coming soon 與完整訓練腳本稍後釋出
官方 repo 已建立並採 Apache-2.0 License,但完整訓練程式碼與 scripts 截至 2026 年 8 月 9 日尚未釋出。圖/AgentOPSD GitHub README

換句話說,目前是公開預告 repo,不是可重現的完整 code release。Hugging Face 排名、upvotes、views 與 stars 可以解釋研究為何快速擴散,卻不能替缺少的實作、seeds 與獨立重現補票。


七、AlphaLab 的判讀:新意是真的,但比「找出哪一步有功」更窄

判讀一:它是 bounded advantage reweighting,不是因果 credit oracle

teacher–student gap 只評估已經發生的 action,而且 teacher 的「成功相關性」來自訓練期技能 context。它沒有回答「若把這一輪換成另一個 action,後續成功率會變多少」。這也是 CRAFT 這類 counterfactual 方法特別想補的問題:它不重跑同一 prefix 的替代 action,而是在 exchangeability 假設下,用同題 sibling rollout pool 估計 group-level counterfactual credit。作者報告的 benchmark 提升與 AgentOPSD proxy 有助於該設定下的最佳化一致,不能單獨證明它準確定位了真實因果功過。

判讀二:遞迴 credit 不是新題目,這篇的新意在訊號組合

延遲回報重新分配早有 RUDDER;critic-free 的 agent step credit 也已有 GiGPO。直接方法譜系中,OPSD 已提出同模型、privileged-context teacher/student dense signal,RLSD 已用 teacher–student likelihood ratio 與保留 outcome sign 的 bounded reweighting,StepOPSD 則已移到 step/turn granularity。另有 HCAPO 用 final-state hindsight context 下的 action likelihood ratio 處理長軌跡;7 月的 TRACE 在 tool boundary 用 frozen reference model 對 gold-answer prefix 的 log-prob 建立 state value,再取 TD-style difference。

因此,AgentOPSD 的新意不能只概括成「critic-free turn credit」。較可辨識的增量,是把 privileged skill OPSD token gap 聚合到 turn,再加入 decayed log-odds state、相鄰 belief revision 與 bounded sign-preserving shaping。作者沒有與 HCAPO、TRACE 或 CRAFT head-to-head;跨論文資料、reward 與 prompt 都不同,不能直接比較排行榜。

判讀三:訊號可能混入 action 長度與 SkillBank 品質

論文的 eₖ 是整輪 token log-gap 的直接總和,沒有按 action 長度正規化;action 長度會改變相加項數,雖然正負 gap 可能互相抵消,仍可能影響 eₖ 的尺度與變異,讓所謂「pivotal」部分混入 verbosity 或格式差異。鄰近的 StepOPSD 正因類似風險加入 equal-step normalization,但 AgentOPSD v1 沒列 length-normalized ablation。

teacher 的品質又取決於 SkillBank。AgentOPSD 說 privileged skills 取自 SkillRL;SkillRL 的方法包含分析 failed validation trajectories 並演化 SkillBank,但 AgentOPSD v1 沒交代實際採用的 SkillBank artifact、snapshot 與建庫 split。因此目前無法稽核它的資料 provenance 與 evaluation isolation,也不能據此直接判定是否有資料洩漏。這主要限制 89.1% 絕對泛化的解讀;作者稱 privileged baselines 共用同一批 skills,所以不會自動推翻同資訊條件下的 shaping 相對比較。

判讀四:穩定邊界同時是優點與天花板

0.9–1.1 倍的限制讓 noisy evidence 不至於一票否決 outcome reward;這種 bounded update 可能有助於作者報告的 point estimates,但現有實驗沒有建立跨 seed 的穩定性。同一限制也讓失敗軌跡裡的好步驟仍繼承負 advantage,成功軌跡裡的壞步驟仍繼承正 advantage,無法反轉成相反方向的 reward signal。若未來要處理安全關鍵 Agent,「做了未授權行動但最後任務成功」不能只調低同號 advantage,而需要獨立的 process verifier、constraint reward 或事件級拒絕規則。

我同意的部分:把不需額外 learned critic/environment rollout 的 skill-conditioned self-teacher 當成 dense evidence,再以歷史狀態與 bounded shaping 接回 GRPO,是一個務實、可檢驗的研究設計;作者的一次性 ablation 也與 recursion、prior 與 outcome alignment 在該設定下有效的解釋一致。

我存疑的部分:「逐步推算各輪行動貢獻」很容易被讀成已辨識真實功過。論文自己只主張 Bayesian-inspired proxy 與 relative support;沒有 counterfactual ground truth、calibration、multi-seed error bars 和可用程式碼時,最合理的稱呼是遞迴、歷史感知的 turn-level 梯度重加權


八、接下來真正值得驗證的五件事

  1. 先重現,不先擴大宣稱:等完整 training code、SkillBank snapshot 與資料切分釋出後,重跑 3B/7B 結果並加入至少多個 seeds、信賴區間與總算力。
  2. 驗證 credit 是否真的指到關鍵輪:建立人工 pivotal-turn 標註,或替換高/低分 action 後重跑 continuation,檢查 ΔBₖ 排名是否預測實際 outcome change。
  3. 拆掉長度捷徑:比較 token sum、per-token mean、equal-step normalization 與固定 action template,確認提升不是靠回覆更長或格式更像 skill。
  4. 處理 zero-variance group:針對全敗/全對 rollout,引入跨題 baseline、exploration curriculum 或獨立 process feedback;否則最困難、成功率為零的題目仍沒有 reward-derived policy-gradient signal。
  5. 進入 production 前做分層 Evals:把最終成功、工具選擇、參數正確性、權限違規、重試與恢復分開量測。先用 AI Evals 建立可回歸案例,再把 credit shaping 當成候選訓練策略,而不是可靠性本身。

AgentOPSD 最值得留下的觀念,是「同一個 final reward 不必平均廣播給所有決策」;它最需要被保留的警語,則是「proxy 能改善訓練,不等於 proxy 已還原因果」。如果後續程式碼、資料 lineage 與獨立重現都補齊,這套遞迴 evidence state 值得測試能否成為 critic-free agent RL 的實用零件;在那之前,89.1% 應被當成一張研究邀請函,不是 production agent 的驗收單。

接著閱讀

左右滑動查看更多推薦

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。