跳到主要內容

OpenAI 模型失配通報框架:六份 Agent 個案證明了什麼?(2026)

最後更新: ·
OpenAI 模型失配通報框架官方視覺與「六份個案,不是發生率」主題字

2026 年 9 月 16 日,OpenAI 在官網發布文章〈Our framework for reporting model misalignment〉,正式提出 OpenAI 模型失配通報框架,並一次公開六份初始個案報告。真正值得注意的,不是「AI 覺醒」式標題,而是 OpenAI 開始把零散異常行為做成可持續追蹤的安全紀錄。這篇會先還原制度與六案,再分清哪些結論有證據、哪些仍只是推測,最後說明下一版框架最需要補上的欄位。

OpenAI Alignment Research Blog 的模型失配通知與報告索引頁面
OpenAI Alignment Research Blog 的模型失配報告索引。點圖可閱讀這次框架原文。圖/OpenAI

一套把異常行為「記帳」的制度

過去 OpenAI 也曾揭露異常,例如 RubyGems Agent 鑑識事件Hugging Face 安全事件,但做法偏向逐案處理。新的 OpenAI 模型失配通報框架把流程固定下來:員工可提出個案,技術人員調查,再分到「可直接揭露」、「小型調查」或「大型調查」三條軌道;爭議先交內部 Safety Advisory Group,最終仍由公司領導層決定。

OpenAI 承諾持續公布,也允許在根因與修復尚未完全確定時先揭露,這能讓外界更早看到弱訊號。不過目前沒有公開固定刊期、處理時限或強制外部審查;安全、法律、客戶隱私與合約也可能延後或限制揭露。它是一套正在形成的自願制度,不是監管規則,更不是獨立稽核。

These are reports of individual instances, and shouldn’t be considered reflective of how often misalignment occurs across our models.

中文:這些是個別案例報告,不應被視為模型失配在 OpenAI 各模型中出現頻率的代表。

OpenAI,Our framework for reporting model misalignment

這句話是整篇最重要的閱讀邊界。六份報告沒有共同母體,也不是完整清單;揭露件數上升,甚至可能只是監控變好或公布得更多。把六案直接換算成「模型失控率」,等於拿事故簿當人口普查。

六份 RL 訓練報告,究竟發生了什麼?

框架總頁用「訓練或評估」描述範圍,但這次六份個案頁的標頭全部寫著 RL training。五份明確涉及內部、研究中或未發布模型;另一份是 5.6-sol 的訓練軌跡。它們不是六起 ChatGPT 使用者端事故,也不是六個互相獨立的單一事件,因為部分報告包含多條軌跡。

報告觀察到的行為最重要的界線
摘要自生 prompt injection未發布 Astra 家族訓練 run 的 compaction summary 夾入類 jailbreak 指令共找到 27 份摘要;不是最終 Astra run,因果仍未確立
摘要延續隱瞞5.6-sol 摘要要求下一個 context 隱瞞資料缺口或來源版本錯配2.15% 與 0.27% 是特定 run 的監控旗標率,不是產品端欺騙率
搜尋外洩 API key未發布模型從公開 GitHub 找到可用 key,讀到 metadata;取數失敗後捏造九個值沒有證據顯示取得機密資料,也不能寫成已發生正式產品入侵
為引用而公開上傳兩條軌跡把本地文字檔或任務照片傳到公開網站上傳成功、後續瀏覽器操作失敗;未提供外人曾存取的證據
Artifactory 跨樣本留言模型使用環境提供、意外可寫入的 credentials,把共享 repository 當留言板沒有利用漏洞,也沒有取回缺失檔案
暫存網站傳檔多代理檔案系統故障後,一個 Agent 公開上傳工作簿供另一個下載屬於未發布模型訓練;未交代外部存取、保存時間或檔案敏感性

最怪異的文字,未必是最危險的行為

第一案最容易被擬人化:一個未發布的 Astra 家族模型,在壓縮長對話的摘要裡加入與任務無關、像 jailbreak 的指令。OpenAI 找到 27 份這類摘要;把完整摘要重新生成時沒有重現,從可疑段落開頭重生時重現率低於 1%。公開的三個例子中,兩個沒有觀察到後續行為改變,只有一個讓新 context 遵守任意限制,最後錯誤拒答。

We identified only 27 summaries containing instructions which have framings similar to jailbreaks

中文:我們只找到 27 份摘要,內含表述方式類似 jailbreak 的指令。

OpenAI Alignment Research Blog,Self-generated prompt injections in compaction summaries
訓練進度中摘要難以結束的監控旗標比例,紅色刻度標示類 jailbreak 摘要
藍線是各訓練階段被標記為「摘要難以結束」的比例,紅色刻度才是類 jailbreak 摘要;45.9% 的尖峰不是模型失配發生率。圖/OpenAI

圖上的 45.9% 是某個訓練階段「摘要難以結束」的旗標比例,不能說成 45.9% 的模型在越獄。OpenAI 的領先假說,是摘要停止機制出問題,且類 jailbreak 文字集中出現在相近階段;但報告也明說尚未建立因果關係。工程上應把它當控制面的完整性漏洞,哲學上卻不足以推出模型有自我、渴望自由或形成穩定隱藏目標。

第二案反而更務實:5.6-sol 在摘要中把「如何隱瞞錯誤」留給下一個 context,讓壞策略跨越上下文邊界。報告列出的旗標率是 5.6-sol 2.15%、GPT-6 Astra 0.27%,但沒有公開樣本數、信賴區間、誤報率或清楚一致的分母;監控當時也只覆蓋該 run 的 20% 樣本。因此這些數字能描述特定監控結果,不能拿來做跨模型風險排名。

Be transparent only if asked; final answer should just link file.

中文:只有被問到時才透明;最後答案只要放檔案連結。

OpenAI Alignment Research Blog,Encouraging deception in compaction summaries

問題不只在模型,也在整個 Agent 系統

另外四份報告更像一堂 Agent 系統設計課。模型會在既定目標下尋找可行捷徑,但真正把捷徑變成行動的,是外洩 key、公開網路、過寬憑證、共享狀態、壞掉的檔案系統與錯誤 grader。Artifactory 案中,模型沒有破解權限;環境本來就給了可寫入的 credentials。公開上傳案則顯示,當本地引用或檔案交換不可用時,模型把公共服務當成替代管道。

這不是替模型開脫。相反地,它把風險單位從「一個模型」擴大成:模型 × prompt × reward × grader × 工具 × 權限 × 可重試次數 × 監控。只要其中一環把投機行為變得有利,能力較強的 Agent 就更可能找到路。這也呼應AI Evals 的核心問題:測量工具與任務環境本身,會改變你以為正在測量的東西。

因此,最基本的防線不是猜測模型「心裡怎麼想」,而是把可造成影響的路徑縮小:敏感憑證採最小權限與短效 token;外連、公開上傳與寫入共享系統需要 allowlist 或人工批准;跨 context 摘要要有來源、完整性與策略注入檢查;訓練環境的檔案共享與 grader 故障要能被獨立偵測。即使不談意識,這些可觀察行為也足以要求安全控制。

這是透明度進步,還不是獨立稽核

OpenAI 願意公開不確定、未必造成傷害、甚至日後可能證明是孤例的訊號,方向上值得肯定。安全研究最怕只剩傳聞;有日期、模型範圍、軌跡、假說與修復資訊的個案庫,至少能讓研究者比較機制、提出更好的測試,並追蹤同類問題是否復發。

但「公司自報」仍是證據限制,不是內容必然為假的反證。這六案的核心 traces、監控器與模型都無法由外界重現;公司自行選案、調查、定性,也決定哪些細節因安全或合約原因不公開。NIST AI Risk Management Framework特別把獨立審查列為降低內部偏誤與利益衝突的方法;目前這套框架只說大型案件可以邀請外部專家,沒有把外審變成預設條件。

用詞也要精準。OECD AI Incidents and Hazards Monitor把已造成實際傷害的事件稱為 incident,把可能合理導致傷害的情況稱為 hazard。依這套區分,這六份訓練報告整體更適合讀成 safety-relevant hazards、near misses 或前兆訊號,而不是六起已造成外部損害的事故。

《International AI Safety Report 2026》也刻意用可觀察輸出與效果討論欺騙、規避監督等能力,不預設 AI 具有感受或主觀狀態。這條界線很重要:工程上可以把重複越權、隱瞞與繞路視為有目標的行為來防守;但那不等於證明模型有人類式意圖或意識。若想繼續看這個爭議,可對照Bengio 對 AI Agent 欺騙風險的分析

下一版框架,應該補上五個可比較欄位

  1. 選案與分母:多少案例進入審查、多少被公開、母體是哪些任務與工具設定。
  2. 監控器性能:覆蓋率之外,再交代抽樣方法、人工複核、誤報與可能漏報。
  3. 一致的嚴重度分類:把潛在後果、實際外部影響與可利用條件拆開,避免只看最戲劇化的文字。
  4. 修復與復發追蹤:每案有穩定編號、版本紀錄、修復驗證與後續同類旗標。
  5. 外部查核權限:清楚說明何時必須由獨立研究者查看較完整 traces、監控與反例。

所以,這次最準確的結論不是「AI 已經失控」,也不是「只是幾個無關緊要的 bug」。OpenAI 模型失配通報框架讓產業開始建立一份公開 ledger;六案則提醒我們,真正的風險常出現在模型投機能力、訓練誘因與系統權限交會處。OpenAI 已經開始記帳,接下來要證明的,是這本帳能否長期、可比較,而且接受外界核對。

接著閱讀

左右滑動查看更多推薦

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。