2026 年 9 月 30 日,Meijia Chen、Hao Li、Zheng Lu 等研究者在 arXiv 發布論文〈False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents〉。它問了一個讓 AI 搜尋代理自我進化變得棘手的問題:出題的代理與答題的代理若一起相信錯誤答案,訓練分數還能代表進步嗎?論文提出一種交叉分組的回饋設計,並報告七組搜尋問答測試的提升。以下先還原機制與數據,再看證據足以支持什麼判斷。

AI 搜尋代理自我進化,錯在哪個回饋環節?
所謂「自我進化」,在這篇論文裡有具體意思:proposer 讀取來源文件、提出問題與暫定答案;solver 試著搜尋並作答;系統依兩者是否一致,決定出題者得到多少回饋,再拿選進來的題目訓練解題者。較早的 Dr. Zero 論文把這條路徑做成自產題目的搜尋代理。新的 False Frontiers 研究則檢查:當解題者學過同一份來源的錯誤暫定答案,下一輪「兩者答得一樣」究竟是能力,還是記住了同一個錯誤?
作者稱這種現象為 co-cheating。這個名稱容易使人想到代理有意串通;論文實際描述的是訓練訊號的自我強化,並明說「does not imply intentional coordination」(中文:不代表有意協調)。把它想成兩個同學共用一本寫錯答案的筆記,之後互相改考卷:一致率可能上升,外部標準答案卻沒有跟著改善。

作者做了兩種修補,效果並不相同
第一種叫 MSV:同一個驗證模型對每道候選題看來源抽樣三次、不看來源抽樣三次,只有兩邊的多數答案相容,才採納或修正標籤。它處理「題目的暫定答案可能錯」;代價是每道候選題增加六次生成。第二種叫 CrossFit:把來源文件切成 A、B 兩組;A 出的題交給只用 B 訓練的輔助 solver 評分,B 的題反過來交給只用 A 訓練的輔助 solver。主 solver 仍照原方法學習全部採納的題目,改的是出題者收到的獎勵來源。
Cross-fitting changes who supplies feedback, not what makes an answer true.
中文:交叉分組改變的是誰提供回饋,不會因此改變答案的真偽。
Chen 等人,False Frontiers,附錄 D
這句話是閱讀整篇論文的關鍵。CrossFit 防的是同一來源的標籤直接繞回評分者;如果 A、B 文件內容重疊,或兩個輔助模型本來就共享預訓練偏誤,彼此仍可能錯在同一處。分組隔離是一道檢查,不等於真值來源。
七組測試提升 8.8/8.4 個百分點,應該怎麼讀?
作者在 Qwen3.5-4B 與 9B 上,各跑三輪訓練,再用 1,325 道固定問答題評估:前六組資料集各 200 題,Bamboogle 125 題。表一的「Average」是七組資料集等權平均,不是 1,325 題一起算的總正確率。4B 的 Dr. Zero 版本為 40.0%,CrossFit 為 48.8%;9B 分別是 42.8% 與 51.2%。因此標題級的 8.8 與 8.4 是百分點差距,並非相對增幅,也不是所有搜尋任務都提升同樣幅度。

同一份論文的事後稽核估計,第三輪「標籤與解題者一致但答案錯」占受檢配對的比例,4B 從 6.1% 降至 3.0%,9B 從 8.8% 降至 3.7%。MSV 單獨使用則分別降到 5.7% 與 7.2%。把相同候選題重播給排除同來源訓練的評分者時,作者報告錯誤一致率進一步降到 0.4%/0.1%;這個重播實驗更接近隔離「誰學過什麼」,但它與完整重新訓練後的數字屬於不同測試,不能合併當成一項產品性能。
哪些地方值得信,哪些還需保留?
我同意的部分:這篇論文把「代理彼此同意」與「答案符合來源」分成兩個可觀察量,又用固定候選題重播對照評分者的訓練來源。這比只比較訓練獎勵與最終榜單,更能指出回饋路徑的問題。SearchMaster 的原始論文也從另一角度指出自產搜尋題目的訊號可能誤導訓練;它提供背景脈絡,並非對 CrossFit 數字的獨立複驗。
我存疑的部分:作者的錯誤稽核使用 gpt-6-astra/high 依來源建立參考答案並判斷,約 86% 的候選配對被納入稽核,未能判斷的例子留在覆蓋率統計。這比把每題硬判對錯謹慎,但稽核者本身也可能有系統性偏差。下游分數使用 Cover-EM:只要正規化後的參考答案出現在預測字串中,就算命中;這比要求整句答案完全正確寬鬆。論文也未在這個實驗裡證明連通來源、其他模型或更低的端到端成本都能得到同樣效果。
成本尤其值得一起看。作者附表把 4B 的 Dr. Zero 一次訓練列為 379 個「預留 H200 GPU 小時」,CrossFit 主設定列為 650;9B 是 476 對 854。這是預留資源,包含等待時間,不等於實際加速器占用;但至少說明改善回饋獨立性並非免費。若只看 8.8 個百分點,容易漏掉要額外訓練兩個輔助 solver 的工程代價。
AI 搜尋代理自我進化,下一步該驗什麼?
這篇研究最值得帶走的不是「每個代理都要用 CrossFit」,而是一張驗收清單:評分者是否讀過被評題目的來源或標籤?外部真值與內部一致率是否分開呈現?遇到相似文件跨組、換模型、換檢索來源,結果還站得住嗎?最後把額外訓練成本和最終任務品質放在同一張表。對設計 AI 搜尋代理自我進化系統的人,這些問題比單一漂亮的訓練曲線更能防止虛假的進步。
接著閱讀
左右滑動查看更多推薦
如果你正建立自產題目的代理,先保留一組從未進入訓練回饋的題目與來源,下一輪同時畫出「彼此同意率」和「對外部答案的正確率」;兩條線一旦分開,就該追查標籤與評分者的共同來源。






