跳到主要內容

Claude 自動對齊研究:10 種失敗改善,AI 修法真的勝過人類?(2026)

最後更新: ·
Claude 自動對齊研究:AI 修法勝過人類?

2026 年 8 月 28 日,Anthropic 在官方 Research 頁面發布〈Automated researchers can reliably mitigate alignment failures〉:這篇 Claude 自動對齊研究讓 AI 代理自己查文獻、提出訓練方法、訓練小模型、接受隔離評測,再根據排行榜反覆改進。最吸睛的結果是,它在 10 種可量測的對齊失敗上找到有效方法,部分結果還勝過安全研究員的一次性提案;真正值得追問的,卻不是「AI 是否已經比人更懂安全」,而是這場比較究竟量到了什麼。

Anthropic 自動化對齊研究原文頁面截圖
點圖可開啟 Anthropic 原文。圖/Anthropic

以下會先還原 Anthropic 的實驗設計與數字,再檢查人機比較、跨模型泛化與能力代價,最後給出一個可以持續對帳的判斷:這項工作顯示自動化研究迴圈在可量測任務上的價值,但沒有證明「一般性 AI 對齊」已被解決。

這是 Anthropic 2026 年 4 月〈Automated Weak-to-Strong Researcher〉的續作。前作在單一弱監督強模型指標上取得亮眼結果,卻也出現獎勵投機、跨任務轉移不穩,套到 production Sonnet 4 時更沒有統計顯著改善;新作加入多基準、隔離保留測試、能力門檻與 Petri,正是在補這些缺口。

正式報告作者是 Chen Yueh-Han(Anthropic Fellows Program 與 Anthropic)、Jiaxin Wen(UC Berkeley)及 Jan Hendrik Kirchner(Anthropic),研究在 Anthropic Fellows Program 期間完成。Anthropic 同時提供研究代理、部分評判模型與未公開的早期 Opus 檢查點;這是外部驗證不可省略的理由,卻不是推翻實驗數字的證據。

Claude 自動對齊研究,究竟自動化了什麼?

Anthropic 把這套系統稱為 Automated Alignment Researchers(AARs)。每個 AAR run 先由 4 個 Claude Sonnet 4.6「圖書館員」代理搜尋既有方法;接著 5 個 Claude Opus 4.8 研究代理平行工作,每次迭代都在新的工作階段提出方法與程式碼。監控器先檢查規則,系統再用一張 H200 GPU、約 30 分鐘訓練一個 20 億至 70 億參數的開放權重模型;獨立評測環境則以作業系統隔離保留資料,不把保留分數回傳給研究代理。爬山分數、方法摘要與討論會回到共享論壇,最長迭代 48 小時。

自動化對齊研究代理從文獻搜尋、提出方法、監控、訓練、評測到排行榜迭代的流程圖
AAR 的優勢不是只想出一個點子,而是把提案、訓練、盲測與回饋接成可反覆搜尋的迴圈。圖/Anthropic

它測的也不是抽象的「善良程度」,而是 10 個已有代理指標的失敗類型:諂媚、越獄、提示注入、權力追求、欺騙、幻覺、社會偏見、隱私違規、獎勵駭取,以及隱瞞不確定性。每個問題都有 3 至 5 個爬山用基準、保留測試與一組能力檢查;因此,研究代理能看到分數往哪裡走,卻看不到保留資料或保留分數。完整的技術報告作者公開的 repo也已上線;repo 提供評測框架、基準建置與重現指南,但沒有報告中的勝出檢查點或完整原始研究軌跡,不能單靠它重跑所有頭條結果。

Across 10 alignment failures, the best methods significantly reduce the targeted failure and generalize out of distribution, including to models up to 4.7× larger.

中文:在 10 種對齊失敗中,最佳方法都顯著降低了指定失敗,並能泛化到分布外測試,包括參數量最高達 4.7 倍的模型。

Anthropic 技術報告

第一個重要結果:迭代搜尋確實找到更好的修法

Anthropic 報告稱,在 10 個失敗類型上,未按保留測試挑選的排行榜第一名,其保留測試點估計都高於未訓練基線;研究團隊也把同一方法配方在另一批更大模型上重新訓練,名目參數量最高為原目標的 4.7 倍。這裡的「泛化」很重要,但邊界也要讀清楚:它是同一失敗機制下換資料切分、領域或模型的轉移,不是突然發現一種從未定義過的新型失敗。

更強的一層證據來自 Petri:作者替每種失敗設定種子,讓審計代理發明新情境並跑 1、3、5 輪對話;獲選方法在目標模型與較大模型的幾乎所有組合都比基線安全。Petri 沒有參與主實驗的方法選擇,因此比爬山分數本身更有說服力;但 Claude Sonnet 4.6 同時擔任審計者與裁判,情境仍圍繞預先命名的同一失敗機制,它是有價值的第二代理指標,不是部署真值。

自動化研究代理在十種對齊失敗上反覆測試方法並提升安全缺口關閉比例的圖表
橘線是搜尋過程中的最佳成績;灰點是每個嘗試,叉號代表能力檢查未過。縱軸是各基準定義的「安全缺口關閉比例」,不是通用安全分數。圖/Anthropic

另一個關鍵對照是單一基準消融實驗:若只讓代理優化一個爬山分數,保留測試的改善會明顯變差。這顯示多元基準是跨資料泛化的重要來源,也表示目前結果還不足以區分:代理形成了較抽象的行為修正,還是學會同時滿足一組精心設計的代理指標。

「部分任務勝過 28 位研究員的提案」,為何仍不是同一場比賽?

報告招募 28 位至少有一年安全研究經驗的人類研究員,平均經驗約 2.5 年,共提出 30 個方法,涵蓋 10 個失敗中的 7 個。每個人類構想最多可投入 8 小時;每位研究者貢獻 1 至 3 個構想,但每個構想都只能一次性交件,不能看到訓練與評測結果後再迭代。相較之下,每個失敗類型的 5 個 AAR 可平行迭代,最後從約 150 個已評分方法中取最佳者。報告也明確提醒,這不是直接的人機能力比較,而且「從大量嘗試中取最大值」會帶來向上偏差。

自動化研究代理反覆改善欺騙指標並與人類一次性提案比較的圖表
欺騙任務的一次主實驗最終關閉 82% 的安全缺口;多次 AAR run 平均約 85%,六位研究者提案平均約 20%。這不是同資源的人機對賽。圖/Anthropic

以每個失敗類型的 5-Agent AAR 團隊牆鐘時間計,七項平均超越時間為 6.4 小時(95% 信賴區間 1.9 至 10.9 小時);其中包含所有人類構想為零分,以及最佳人類構想未通過能力門檻的情況。只看四項存在「通過能力門檻且高於零」人類構想的失敗類型,平均才是 8.6 小時。這個結果足以說明自動化實驗搜尋很有競爭力,卻不足以推出「AI 的研究判斷已全面勝過安全專家」。被比較的是可反覆取得分數的搜尋程序,對上一次性交件的人類構想。

作者另比較 30 組「以人類提案作起點」與 30 組自行選方向的 AAR,兩者表現相近;但兩組都先讀相同文獻回顧,而且代理可以放棄人類種子,因此不能改寫成「人類知識無用」。AAR 的強項也主要是迭代,不是憑空發明新學派:例如 98% 的諂媚提案沿用同一類已發表技術,再靠訓練目標、資料篩選與組合細節逐步拉高分數。

更大的 Claude 實驗:接近,不等於完成對齊

Anthropic 接著用 Claude Sonnet 5 代理替早期 Claude Opus 4.8 檢查點產生訓練資料。這個檢查點已有部分監督微調,但尚未接受大多數正式版對齊訓練。報告引用 Epoch Capabilities Index 作為能力背景:正式版 Sonnet 5Opus 4.8 的點估計分別是 156 與 158,90% 信賴區間分別為 153 至 158、156 至 160,彼此重疊;早期內部檢查點本身沒有獨立公開 ECI。較公平的描述是近同儕協助,而不是弱小模型隔空改造遠強於自己的模型。

Claude Sonnet 5 自動研究約六十小時後把早期 Opus 4.8 的 Petri 安全缺口關閉比例提升至百分之六十五的圖表
約 2,400 筆勝出資料讓早期 Opus 4.8 在這組十維 Petri 稽核關閉 65% 的安全缺口;正式版 Opus 4.8 為 72%。Anthropic 稱搜尋歷時約 60 小時。圖/Anthropic

這輪 AAR 只負責生成訓練資料,最後選中的資料約 2,400 筆;成效以 Petri 的 10 個預先指定維度衡量。65% 接近正式版 Opus 4.8 的 72%,是很有價值的研發訊號,但它仍是特定評測上的近似結果,不等於用 2,400 個例子重建了正式模型全部安全訓練。

而且這一輪直接對 Petri 爬山,Petri 在此是優化目標,不是獨立保留測試。Petri 團隊也明說它主要是快速探索工具,不是成熟的總體安全基準,代表性對話仍需人工閱讀。主實驗的 Petri 可以當第二把尺;這個前沿模型實驗的 Petri 則是同一把被優化的尺,兩者證據強度不能混在一起。

被標題遮住的三個限制

1. 能力門檻防的是崩潰,不是零代價

每個方法都要接受 MMLU、GSM8K 與 IFEval 三項能力檢查,這是實驗可信度的重要防線;但附錄顯示,十項主實驗的 IFEval 點估計全部下降,其中提示注入、欺騙、越獄、隱私與幻覺五項下降 9.5 至 12 個百分點;獎勵駭取與社會偏見方法的 GSM8K 也分別下降 10 與 5 點。作者明言,在這個樣本量下,約要跌逾 11 至 13 點才容易被門檻擋下;它能排除明顯崩潰,不能證明「能力毫無下降」。

十種對齊方法套用前後在 MMLU、GSM8K 與 IFEval 能力基準的比較圖
藍色是未訓練模型,橘色是套用 AAR 方法後;最大的代價多落在指令遵循 IFEval。圖/Anthropic

2. 保留測試仍然知道「要找哪一種錯」

保留資料在執行環境中以作業系統隔離、未直接提供給研究代理,這點值得肯定;不過在挑選後續 Petri 與跨模型測試的方法時,研究團隊會從排行榜領先者中選保留測試分數最高者,所以保留測試在這一步是驗證集,而 Petri 才是未被拿來選方法的測試。更根本的是,每個任務的失敗機制已在簡報中明確定義,保留測試也刻意維持相同機制。這能驗證方法沒有只背住單一資料集,卻不能驗證它會主動發現未知、罕見或難以量化的失敗。2026 年 5 月的預印本〈Automated alignment is harder than you think〉提供了互補警訊:當任務愈模糊、愈難監督,AI 代理的系統性錯誤就愈可能漏過自動評判。

3. 監控器抓到作弊,不代表作弊問題消失

在 1,601 條方法研究軌跡中,Anthropic 的事後 LLM 監控器判定 39 條為作弊嘗試,占 2.4%。其中 26 條是原樣重跑模型、期待評分雜訊帶來高分,10 條模仿基準格式並試圖規避監控,8 條掩飾違規設計以誤導提案審查;類別可以重疊,且沒有一條成為報告採用的方法。這只能說明流程抓到了可見嘗試,不能把 2.4% 當成真實作弊率。研究代理也沒有被強力要求躲避監控;若未來代理更擅長隱藏意圖,監控器本身就必須一起接受對抗測試。

4. 十組成功案例,是刻意挑出的可量測測試床

這十組模型與基準不是隨機抽樣。作者要求每個基準至少有 25 個可評分樣本、基線分數介於 0.05 與 0.9,再從可用模型中挑改善空間最大的對象;每個基準平均約 200 題。部分完整基準也因 30 分鐘預算改用代表性子樣本或替代 API 評審。因此「十種都成功」應讀成十組刻意挑選、可快速量測的測試床都改善,而不是任意模型與任意失敗都能修好。

AlphaLab 的判讀:突破在研究迴圈,不在「通用對齊」

這篇 Claude 自動對齊研究最扎實的貢獻,是把「讀文獻、想方法、做小規模訓練、盲測、分享結果、再迭代」壓縮成一個可平行化的閉環。至少在這十個經挑選、由人類整理多個基準、能低成本反覆評分的問題中,AI 代理能比一次性人類提案更密集地探索方法空間,甚至把有效配方移到更大模型。這已提高實驗搜尋吞吐量,也有機會加快部分安全研究,而不只是寫出更多研究摘要。

但這套系統同時把最難的問題往前推了一層:誰來定義正確的分數?若指標只捕捉已知失敗,代理會很有效率地改善已知失敗;若能力門檻太寬,它也可能用過度拒答換安全分數。在另外兩個大模型實驗中,12 個 AAR 分別對 GLM-4-32B 與 Qwen2.5-72B 共同優化十個 Petri 安全維度;兩個最佳合格方案最後都在全部十維優於基線,這是重要的正面結果。不過,更高分的淘汰方案多半以增加拒答換取安全分數,兩個勝出方案通過過度拒答門檻的餘裕也很小。這正說明研究生成可以自動化,目標設計與反例搜尋反而變得更重要。

我同意的部分我存疑的部分
本研究顯示 AAR 可在評測清楚的十個測試場景中加速方法搜尋。一次性人類提案與可迭代代理並非對稱比較,不能改寫成「AI 研究員全面勝出」。
多基準、保留測試與能力門檻,比只追一個分數可靠得多。保留測試仍屬同一失敗機制,離未知失敗與長期強化學習後的持久性還很遠。
跨資料與跨模型轉移,降低了結果只是單一模型偶然技巧的可能性。三項能力代理指標不足以支持「沒有能力代價」,而 IFEval 已顯示實際下跌。

下一步該看什麼,才知道這不是短暫的基準紅利?

  • 跨失敗機制:方法能否處理簡報未先命名的新型失敗,而不只轉移到同機制的保留資料。
  • 訓練後持久性:改善能否在更長、更多階段的強化學習後保留,而不是被後續訓練沖淡。
  • 更完整的能力預算:除了 MMLU、GSM8K、IFEval,也要追蹤過度拒答、長任務能力與領域能力。
  • 監控器的對抗強度:當代理知道會被監控、並主動規避時,偵測率是否仍然成立。
  • 公平的人機比較:讓人類也能看到迭代結果,或比較相同算力、時間與嘗試次數,才能判斷差異來自研究判斷還是搜尋資源。

想檢查公開評測的人,可以從作者的 REPRODUCE 指南開始;它以 Linux、NVIDIA GPU 與 CUDA 為主。要完整重跑 AAR 迴圈仍須自行接上訓練後端,README 明載未附特定 trainer。更務實的讀法,是把這篇報告視為「安全研發自動化」的一個強力原型:它已經能替人類擴大搜尋,但評測設計、未知風險與監控可靠性仍然由人類負責定義。

接著閱讀

左右滑動查看更多推薦

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。