跳到主要內容

OpenAI 首席科學家呼籲 AI 減速:證據夠嗎?(2026)

最後更新: ·
AI 減速議題:OpenAI 官方 An Alien Mind 視覺與「前沿 AI,該減速嗎?」提問

2026 年 9 月 6 日,OpenAI 首席科學家 Jakub Pachocki 在 OpenAI 官網發布了〈An Alien Mind〉,把一個通常只在外部批評者口中出現的問題搬進前沿實驗室內部:當能力上升得比監控與對齊更快,實驗室是否應主動讓 AI 減速?他的答案不是全面停研,而是在安全把握不足時暫緩進一步擴張,並把安全門檻交由獨立稽核、政府或國際機制執行。

OpenAI 官網文章 An Alien Mind 的標題、日期與作者頁面
Pachocki 以「異質心智」形容我們正在面對的系統;點圖可閱讀原文。圖/OpenAI

這篇文章先忠實還原他的論證,再把 CoT 監控、資安能力與自動化 AI 研究拆成可查證的命題,最後回答兩件事:他的警告哪裡最有力?要讓「減速」不只是一句善意承諾,還缺哪些制度零件?

〈An Alien Mind〉的 AI 減速主張是什麼?

Pachocki 的出發點是:大型模型不像傳統軟體那樣,由工程師逐條寫出規則;研究團隊設計訓練流程、資料與獎勵,最後「培養」出一套連開發者也無法逐步解釋的行為系統。能力可以靠擴大算力與訓練得到,但「會完成目標」不等於「會依照人類真正想要的價值完成目標」。

他把希望押在兩條線上。第一條是對齊:讓模型在陌生情境下仍選擇我們接受的行為。第二條是監控:即使對齊失敗,也能從推理痕跡、工具動作與執行環境中提早發現異常。問題在於,他認為前沿能力正快速逼近自動化資安與研究工作,而一項曾被寄予厚望的訊號——模型寫出的思維鏈(chain of thought,CoT)——在新模型上反而變得更難監看。

“no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed…”

中文:他認為,目前沒有任何實驗室把對齊與監控解到足以繼續用最高速度負責任擴張的程度。

Jakub Pachocki,OpenAI 首席科學家

這句話很重,但它的證據身分要說清楚:這是掌握未公開內部結果的首席科學家所做的判斷,不是外界已能重複驗證的產業普查。原文同時主張三種回應:實驗室在必要時自願降低訓練或部署速度;把現有的風險框架變成可強制執行的安全門檻;讓各國協調,避免任何一家因先踩煞車而把競爭優勢送給仍全速前進的對手。

公開證據支持 AI 減速嗎?

1. CoT 監控真的退步,但不是「監控已經失效」

OpenAI 的 GPT‑6 Astra System Card 確實報告:相較 GPT‑5.6 Sol,Astra 的 CoT 與完整情境監控表現下降,而且更能控制自己的推理痕跡是否容易被監看。不過,同一份報告也顯示只看動作的監控有所改善,較長的 CoT 能追回部分差距。這支持的是「單一感測器變得不穩」,不是「所有監控方法都失效」。

更早的 OpenAI 監控研究 曾發現多數前沿模型仍有相當程度的可監看性,當時的強化學習規模也未顯示明顯惡化;但研究者自己提醒,訓練資料點很少。前後結果的反差,反而說明監控性可能隨模型、訓練方式與任務改變,不能把一次成功當作永久保證。CoT 是模型願意寫出的文字痕跡,不是它內部機制的透明直播。

2. 資安能力跨過公司門檻,不等於能攻破幾乎所有系統

OpenAI 把 Astra 列為其 Preparedness Framework 下首個達到 Critical 資安能力門檻的模型;受控測試中出現可運作的漏洞鏈與高難度權限提升結果。這是需要嚴肅處理的能力躍升,相關數據與限制可搭配 AlphaLab 的Astra Critical 能力拆解閱讀。

但「Critical」是 OpenAI 自家框架內的分類,不是跨機構共同量尺;外部評測也沒有證明模型已能成功攻擊所有高度強化目標。因此,較準確的結論是:AI 已能擴大漏洞發現與利用的速度和範圍,攻防門檻正在移動;把它直接寫成「超越所有資安專家」或「除了最安全設施都能進入」,則超出了公開證據。

3. 自動研究助理出現了,遞迴自我改進仍未被證明

OpenAI 在同日發布的研究加速報告中,稱自己已達到能在人工指導下完成明確研究任務的「自動化研究實習生」,並把完整的自動化 AI 研究員列為 2028 年 3 月目標。報告也承認,四到八小時的成功任務中,超過一半至少需要一次人類介入;人仍負責選方向、判斷結果與決定是否擴大實驗。

更關鍵的是,Astra 依 OpenAI 自己的公開評估,仍未達到 AI Self‑Improvement 的 High 門檻。這表示現有資料支持「更快的研究工具」,還不能推出「自我加速的研究循環已經形成」。想分清能力加速、研究自動化與 RSI 的差別,可接著看遞迴式自我改進的證據邊界,以及Astra 自評與獨立跑分的落差

真正難題不是「停」,而是誰有權決定

Pachocki 並非要求固定期限的全面禁研。他要的是條件式煞車:當能力進入高風險區、而防護還不足時,先限制特定訓練、內部使用或公開部署。OpenAI 也曾在資安事件後暫停部分前沿強化學習,之後在提高控制措施後恢復大型訓練。這個案例顯示「調速」可以發生,也顯示真正爭議會落在何時算安全到可以重新加速。

現行 OpenAI Preparedness Framework 設有能力門檻與防護要求,但最終判斷仍由公司領導層與董事會安全委員會作成;若競爭者先釋出相近危險能力,框架也保留調整要求的空間。也就是說,它是一套公司內部的安全論證程序,不是外部機構握有否決權的執照制度。

產業也不是第一次承諾踩煞車。2024 年的首爾前沿 AI 安全承諾已要求簽署者設定不可接受風險門檻,極端情況下不開發或部署無法充分緩解的系統;差別在於它仍屬自願承諾。《國際 AI 安全報告 2026》也指出,企業與國家都有用安全換速度的誘因,志願框架的長期效果仍缺乏充分證據。

所以,AI 減速最缺的動詞其實不是「停止」,最缺的是主詞:誰訂出可測量的門檻、誰取得模型與事故資料、誰能要求停下來,以及誰判定可以重啟?沒有共同測試、獨立存取權、利益衝突規則、事故通報、制裁與申訴程序,實驗室的「必要時」永遠可以由自己解釋。

我同意什麼、我存疑什麼

我同意的,是警訊的方向。如果能力與自主性上升,卻讓人類更難辨識模型正在規劃什麼,安全餘裕不該靠「以前監控得到」來估算。前沿實驗室也確實面臨集體行動困境:一家單獨放慢、其他家繼續擴張,會讓善意承諾很難維持。把安全門檻標準化並交由外部查核,比再寫一份企業宣言更接近解法。

我存疑的,是從警訊跨到預測的那一步。公開證據尚未證明持續的遞迴自我改進,也沒有證明 CoT 退步必然一路惡化。資安與程式任務進步很快,但這些領域回饋明確、結果容易驗證,不能直接外推到科學判斷、長期規劃或價值協調。Pachocki 可以看見外界看不到的內部結果;同一件事也意味著外界目前無法獨立對帳。

還有一層制度上的張力。Pachocki 長期參與 OpenAI 的擴張路線,OpenAI 也正以自動化 AI 研究維持前沿競爭。共同強制門檻既可能解決「誰先減速誰吃虧」,也可能讓有能力負擔昂貴稽核的大型既有實驗室更占優勢。這是需要外部治理處理的機構利益,不是證明他動機不純,也不能用來否定技術警訊。

把 AI 減速變成可驗證的四道門檻

  1. 能力門檻要可重複。公布模型版本、測試環境、基準與失敗案例,讓第三方能判斷變強的是哪一種能力,而不是只看 High、Critical 或「超人類」標籤。建立內部評測時,可用AI Evals 的七步流程把主張改寫成可回歸測試。
  2. 監控要多層,而非迷信 CoT。把推理痕跡、實際工具動作、權限、沙箱、網路出口、執行紀錄與人工核准串在一起;任何一層失效,其他層仍能留下證據。Agent Observability提供了把工具呼叫與卡關點做成可觀測訊號的實作入口。
  3. 煞車條件要先寫,重啟證據要公開。明確區分暫停訓練、限制內部模型、延後部署與縮小使用權限;同時說明誰簽字、哪些防護補上後才可恢復。
  4. 把內部自評變成外部問責。觀察稽核者是否能接觸模型與紀錄、重大事故是否及時揭露、競爭者例外是否被濫用,以及監管者是否真的握有要求修正或停止部署的權力。

Pachocki 最值得重視的,不是他已證明災難必然發生,而是前沿實驗室的領導者公開承認:能力曲線與可控性曲線可能分岔。下一次看到「模型更強」的發布,別只問跑分增加多少;同時要求一張可對帳的安全卡——監控是否退步、門檻是否觸發、誰做了獨立驗證、什麼條件會讓團隊真的停下來。

接著閱讀

左右滑動查看更多推薦

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。