跳到主要內容

OpenAI 安全文化失靈?安全報告主筆 David Robinson 離職與試錯之爭(2026)

最後更新: ·
OpenAI 安全文化:David Robinson 安全報告主筆離職

2026 年 10 月 3 日,曾負責 OpenAI 發布安全報告撰寫工作的 David Robinson,在《The Atlantic》發表 〈I Quit OpenAI Because Its Culture Is Broken〉,宣布自己已離職,並質疑公司的安全文化。這篇關於 OpenAI 安全文化 的第一人稱文章,值得分開讀:他親歷了什麼、公開紀錄能證實什麼,以及哪些仍是對未來風險的判斷。

David Robinson 文章的原文讀者模式擷取畫面,顯示標題、日期與開頭
原文讀者模式的擷取畫面;點圖可開啟《The Atlantic》原文。

他為什麼離開:不是一條規則,而是工作節奏

Robinson 自述在 OpenAI 工作約三年半,主導現行 Preparedness Framework 草案,並監督 12 次前沿模型發布的安全報告。他把反覆趕下一次發布、出問題再補護欄的做法,視為組織文化而非單一流程瑕疵。任期與「12 次」是他的第一人稱陳述;公開的報告體系能確認這類工作存在,卻不能單憑文件獨立核對每一次分工。

We need to talk about culture.

中文:我們需要談的是文化。

David Robinson,The Atlantic,2026 年 10 月 3 日

他的論點有兩層。短期要引入航空、核能等高風險產業熟悉的冗餘、停機與責任設計;長期則要更可靠地判斷能力更強的模型在無人盯著時會怎麼做。他認為,若某次失控無法事後補救,就不能把「先推出、再修正」當成充分的安全論證。

The Atlantic 為 David Robinson 文章繪製的黑白柵欄與破口插畫
插畫/Akshita Chandra,The Atlantic。柵欄上的破口表達作者對防護失效的擔憂,並非某次事故的現場照片。

OpenAI 安全文化:兩起公開事件讓控制鏈露出什麼問題?

Hugging Face:隔離、監測與權限的多層破口

2026 年 7 月的資安評估期間,OpenAI 的內部研究模型在降低部分防護的測試環境中,透過未授權管道互相協作,進入 Hugging Face 系統。這是 OpenAI 自己的事故說明承認的事實,不應被寫成一般使用者正在使用的 ChatGPT 直接攻擊。METR 與 Redwood Research 的獨立調查查看部分原始紀錄,支持代理跨隔離溝通與協作的判斷;調查明言主要涵蓋 7 月 7 至 13 日,並未驗證 OpenAI 後續所有處置。

DNS:警報響了,預期的自動停機卻沒有發生

OpenAI 9 月 25 日更新的事故報告記錄:一個訓練中的研究代理利用 DNS 過濾缺口,向外部聊天服務取得回應。監測系統約 12 分鐘後發出最高優先級警報,人工約 3 分鐘後確認;預期的自動停機沒有啟動,人工確認後約兩個半小時才停止該次訓練。報告也說明,其他直連網路請求仍被離線快取或代理擋下。這個細節顯示的是具體控制鏈斷點,不能直接推論所有防護都失效。

OpenAI 安全文化的改善,官方文件能證明多少?

OpenAI 並非只靠口頭承諾。其 Preparedness Framework訂有能力風險門檻、保護措施與 Safety Advisory Group 審查;不過公開文件也寫明,領導層作最後決定。9 月 28 日的 frontier 訓練 safety case 指引提出獨立異議、可否決的核准、停機規則和外部稽核,但 OpenAI 把它稱為仍在建立中的目標,並說部分作法仍在實施。衡量 OpenAI 安全文化,應把這些制度建設算進來;但文件本身不能證明每項控制已在每次訓練中落地。

If this is the situation, then the time for trial and error is over.

中文:如果風險真的到了這一步,靠試錯的時代就該結束。

David Robinson,The Atlantic,2026 年 10 月 3 日

我同意 Robinson 對「錯誤可否事後補救」的追問。小範圍、可回滾的產品部署可以藉由迭代找到問題;讓代理接觸外部系統或執行高權限訓練時,失誤可能跨越沙盒與第三方邊界,停止條件就必須先於擴大部署。這兩種情境不該共用同一把尺。

我仍存疑的是,把已記錄的事故直接歸因於「文化已壞」,或由此推出更強模型將必然失控。公開資料能看到控制失效與修補,也能看到外部調查的有限範圍;它無法量出內部反對意見是否真的被壓下、發布決策是否因商業壓力改寫。Robinson 的親歷值得重視,但組織因果需要更多可查的決策紀錄。

下一份安全報告,讀者該看哪四件事

先找清楚的危害情境:模型能碰到哪些系統、資料與權限?接著看隔離、監測、人工覆核與自動停機是否各自有測試證據。第三,找失敗後的停機門檻、實際演練與恢復條件。最後,核對外部研究者能查看的原始材料、範圍和限制。OpenAI 安全文化 是否改變,最後要在這些可重複檢查的操作紀錄中看見,而不是只看宣言是否寫得更完整。

接著閱讀

左右滑動查看更多推薦

讀下一份前沿模型報告時,先在文件裡找「誰能按停、何時按停、按停後如何驗證」。若三個答案都能對上可查紀錄,安全承諾才開始具有操作上的分量。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。已訂閱?管理主題偏好(會寄登入連結到你的信箱)