跳到主要內容

AI 搜尋代理自我進化:一起答錯也能得分?False Frontiers 論文判讀(2026)

最後更新: ·
AI 搜尋代理自我進化共犯錯誤:答錯也得分?

2026 年 9 月 30 日,Meijia Chen、Hao Li、Zheng Lu 等研究者在 arXiv 發布論文〈False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents〉。它問了一個讓 AI 搜尋代理自我進化變得棘手的問題:出題的代理與答題的代理若一起相信錯誤答案,訓練分數還能代表進步嗎?論文提出一種交叉分組的回饋設計,並報告七組搜尋問答測試的提升。以下先還原機制與數據,再看證據足以支持什麼判斷。

False Frontiers 論文 arXiv 頁面截圖
點圖閱讀原始論文。圖/arXiv 論文頁面

AI 搜尋代理自我進化,錯在哪個回饋環節?

所謂「自我進化」,在這篇論文裡有具體意思:proposer 讀取來源文件、提出問題與暫定答案;solver 試著搜尋並作答;系統依兩者是否一致,決定出題者得到多少回饋,再拿選進來的題目訓練解題者。較早的 Dr. Zero 論文把這條路徑做成自產題目的搜尋代理。新的 False Frontiers 研究則檢查:當解題者學過同一份來源的錯誤暫定答案,下一輪「兩者答得一樣」究竟是能力,還是記住了同一個錯誤?

作者稱這種現象為 co-cheating。這個名稱容易使人想到代理有意串通;論文實際描述的是訓練訊號的自我強化,並明說「does not imply intentional coordination」(中文:不代表有意協調)。把它想成兩個同學共用一本寫錯答案的筆記,之後互相改考卷:一致率可能上升,外部標準答案卻沒有跟著改善。

False Frontiers 圖二:共犯錯誤、多次驗證與交叉分組回饋示意
圖二從左到右畫出共同答錯、六次抽樣驗證,以及讓 A 組題目交由只學過 B 組的輔助解題者評分。圖/Chen 等人,False Frontiers

作者做了兩種修補,效果並不相同

第一種叫 MSV:同一個驗證模型對每道候選題看來源抽樣三次、不看來源抽樣三次,只有兩邊的多數答案相容,才採納或修正標籤。它處理「題目的暫定答案可能錯」;代價是每道候選題增加六次生成。第二種叫 CrossFit:把來源文件切成 A、B 兩組;A 出的題交給只用 B 訓練的輔助 solver 評分,B 的題反過來交給只用 A 訓練的輔助 solver。主 solver 仍照原方法學習全部採納的題目,改的是出題者收到的獎勵來源。

Cross-fitting changes who supplies feedback, not what makes an answer true.

中文:交叉分組改變的是誰提供回饋,不會因此改變答案的真偽。

Chen 等人,False Frontiers,附錄 D

這句話是閱讀整篇論文的關鍵。CrossFit 防的是同一來源的標籤直接繞回評分者;如果 A、B 文件內容重疊,或兩個輔助模型本來就共享預訓練偏誤,彼此仍可能錯在同一處。分組隔離是一道檢查,不等於真值來源。

七組測試提升 8.8/8.4 個百分點,應該怎麼讀?

作者在 Qwen3.5-4B 與 9B 上,各跑三輪訓練,再用 1,325 道固定問答題評估:前六組資料集各 200 題,Bamboogle 125 題。表一的「Average」是七組資料集等權平均,不是 1,325 題一起算的總正確率。4B 的 Dr. Zero 版本為 40.0%,CrossFit 為 48.8%;9B 分別是 42.8% 與 51.2%。因此標題級的 8.8 與 8.4 是百分點差距,並非相對增幅,也不是所有搜尋任務都提升同樣幅度。

False Frontiers 表一:Qwen3.5-4B 與 9B 在七組搜尋問答基準的結果
表一列出兩種模型尺寸、七個問答資料集與等權平均。圖/Chen 等人,False Frontiers 論文第 6 頁

同一份論文的事後稽核估計,第三輪「標籤與解題者一致但答案錯」占受檢配對的比例,4B 從 6.1% 降至 3.0%,9B 從 8.8% 降至 3.7%。MSV 單獨使用則分別降到 5.7% 與 7.2%。把相同候選題重播給排除同來源訓練的評分者時,作者報告錯誤一致率進一步降到 0.4%/0.1%;這個重播實驗更接近隔離「誰學過什麼」,但它與完整重新訓練後的數字屬於不同測試,不能合併當成一項產品性能。

哪些地方值得信,哪些還需保留?

我同意的部分:這篇論文把「代理彼此同意」與「答案符合來源」分成兩個可觀察量,又用固定候選題重播對照評分者的訓練來源。這比只比較訓練獎勵與最終榜單,更能指出回饋路徑的問題。SearchMaster 的原始論文也從另一角度指出自產搜尋題目的訊號可能誤導訓練;它提供背景脈絡,並非對 CrossFit 數字的獨立複驗。

我存疑的部分:作者的錯誤稽核使用 gpt-6-astra/high 依來源建立參考答案並判斷,約 86% 的候選配對被納入稽核,未能判斷的例子留在覆蓋率統計。這比把每題硬判對錯謹慎,但稽核者本身也可能有系統性偏差。下游分數使用 Cover-EM:只要正規化後的參考答案出現在預測字串中,就算命中;這比要求整句答案完全正確寬鬆。論文也未在這個實驗裡證明連通來源、其他模型或更低的端到端成本都能得到同樣效果。

成本尤其值得一起看。作者附表把 4B 的 Dr. Zero 一次訓練列為 379 個「預留 H200 GPU 小時」,CrossFit 主設定列為 650;9B 是 476 對 854。這是預留資源,包含等待時間,不等於實際加速器占用;但至少說明改善回饋獨立性並非免費。若只看 8.8 個百分點,容易漏掉要額外訓練兩個輔助 solver 的工程代價。

AI 搜尋代理自我進化,下一步該驗什麼?

這篇研究最值得帶走的不是「每個代理都要用 CrossFit」,而是一張驗收清單:評分者是否讀過被評題目的來源或標籤?外部真值與內部一致率是否分開呈現?遇到相似文件跨組、換模型、換檢索來源,結果還站得住嗎?最後把額外訓練成本和最終任務品質放在同一張表。對設計 AI 搜尋代理自我進化系統的人,這些問題比單一漂亮的訓練曲線更能防止虛假的進步。

接著閱讀

左右滑動查看更多推薦

如果你正建立自產題目的代理,先保留一組從未進入訓練回饋的題目與來源,下一輪同時畫出「彼此同意率」和「對外部答案的正確率」;兩條線一旦分開,就該追查標籤與評分者的共同來源。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。