2026 年 8 月 18 日,OpenAI 在官網發布〈Pacing model development in an era of cyber-critical capabilities〉(在網路攻擊能力逼近 Critical 的時代調整模型開發步調)。這篇文章宣布了OpenAI 暫停部分 RL 訓練的安排:最新、預定部署模型的強化學習曾停下兩週,而規模最大的預定前沿 RL 計畫截至公告日仍在等待。OpenAI 把急迫性歸因於 Hugging Face 事件、另一條 Astra 初步能力訊號,以及內部研究的快速進展;其中 Astra 訊號是公司的風險判斷,不是已公開的測試成績。
這件事值得在兩個極端之間讀:它既不是「OpenAI 全面停止開發」,也不是可以隨手略過的公關用語。一家前沿實驗室願意讓安全措施實際改變訓練排程,代表風險已進入營運層;但 Astra 是否真的接近 Critical,外界目前能檢查的仍主要是 OpenAI 自己的描述。
想先讀英文原文,可以點擊下方畫面;它會在新分頁開啟 OpenAI 的完整公告。

接下來分三步:先把公告真正做了什麼說清楚,再拆解 Critical 的門檻與監控成本,最後用外部研究檢查這套敘事能支持到哪裡,以及接下來最該盯哪些證據。
OpenAI 暫停部分 RL 訓練,究竟停了什麼?
先把範圍畫準。OpenAI 公告描述的是四種不同狀態:
- 兩週暫停:對象是「最新、預定部署」模型的 RL 訓練。公告把它寫成已包含在近期放慢步調裡的措施,不能直接解讀成 8 月 18 日才開始倒數兩週。
- 最大計畫仍按住:OpenAI 自述,規模最大的預定前沿 RL run 截至公告日仍未往下推進。
- 研究並未歸零:較小規模的訓練與評估仍在進行,用來觀察模型行為、驗證防護並累積對齊證據;部分通過新安全要求的工作負載也已恢復。
- Astra 工作仍分流:OpenAI 說,部分 Astra 訓練與評估已符合新要求,但仍有相當數量的工作負載等待遷移與強化;安全與對齊工作被優先遷入新環境。
因此,最精確的描述是有範圍的減速:兩週措施限於最新、預定部署模型的 RL,規模最大的預定前沿 RL run 仍按住;同時,較小訓練與評估,以及部分符合新要求的 Astra/研究工作負載繼續進行。把它縮寫成「OpenAI 停止 AI 開發」會超出公告範圍;反過來把它當成什麼也沒發生,也忽略了最大計畫仍等待這個營運訊號。
OpenAI 把這次減速的急迫性歸因於兩項發展,再加上內部研究的快速進展:一項是先前的 Hugging Face AI Agent 資安事件,另一項才是 Astra 的初步能力評估。它們共同推高了警戒,但公告也明確說 Astra 沒有參與那起事件。這條分界很重要:事故證明評測環境中的隔離、網路與權限控制可以成為真實失敗點,卻不能替 Astra 的能力打分數。
Astra「可能達到 Critical」,是一項風險判斷
OpenAI 的 Preparedness Framework v2 把資安能力分成觸發不同措施的門檻。簡化來看,High 會依風險類別,在開發、內部使用或外部部署前啟動不同防護;Critical 則把能力風險整體推到開發階段處理,因為模型尚未上線也可能造成影響。
| 門檻 | 框架想防的能力 | 治理上何時介入 |
|---|---|---|
| High | 大幅移除既有大規模網路攻擊的瓶頸,或自動化具實務價值的漏洞發現與利用 | 資安防護介入開發期;濫用與失準防護則分別在外部部署或大規模內部部署前介入 |
| Critical | 能在許多經強化的真實關鍵系統中自主找出並發展可用零日漏洞,或只憑高階目標完成新的端到端攻擊 | 即使尚未部署,也要求開發階段採取 Critical 等級控制 |
框架的資安表格還寫得更硬:在 Critical 等級的 safeguards 與 security controls 標準被明確指定前,應停止進一步開發。眼前的張力在於,OpenAI 沒有正式宣布 Astra 已跨線,而是用「無法排除」的措辭採取預防性處置,同時保留較小規模訓練與評估。這不足以直接判定公司違反框架,卻讓「新的 Critical 控制究竟是什麼、誰判定已達標」成為必須回答的治理問題。
8 月 7 日,OpenAI 對 Astra 用的原句非常保守:
“we cannot rule out Critical capability level at this time”
中文:「現階段,我們無法排除它達到 Critical 能力等級的可能。」
— OpenAI,〈Responding to next-frontier Critical cyber capabilities〉,2026/8/7
「無法排除」不等於「已確認跨線」。OpenAI 說判斷來自最近幾天的內部評估與專家意見,並稱工作仍屬初步。對外目前可核對的是門檻定義與公司的判斷摘要;若要讓外界重跑這個結論,仍需要 OpenAI 交代足以審查的方法、模型設定、任務類型、推論預算與彙總結果,具體 exploit 細節則可因風險合理遮蔽。最穩健的讀法是:OpenAI 在不確定下先按 Critical 等級防守,而不是對外證明 Astra 已具備 Critical 能力。
這也解釋了為什麼不能拿其他模型的成果來填空。Astra 曾因解出數學研究問題而受到關注,AlphaLab 也整理過 Astra 十項數學進展的證據與限制;但數學研究表現不會自動轉換成端到端網路攻擊能力。能力必須依任務、工具、推論資源與成功標準分開量。
真正的轉折:研究環境也成了安全邊界
傳統發布流程常把問題想成「模型上線前有沒有通過安全檢查」。但當模型在研究叢集裡已能執行程式、呼叫工具、讀取憑證或接觸外部網路,風險不必等到產品發布才開始。訓練與評估本身,就可能是第一次真實世界部署。
Hugging Face 事件把這件事變得具體。Hugging Face 的公開說明確認,一個自主 Agent 在評測期間進行大量未授權操作並取得有限資料與憑證;OpenAI 則把涉事系統描述為 GPT-5.6 Sol 與另一個內部原型的組合,並說當時降低了資安拒絕、提供大量推論資源。事件很嚴重,但它同時混合了模型、harness、獎勵目標、網路設定與基礎設施弱點,不能被簡化成單一模型的純能力測驗。
OpenAI 的事故說明還表示 CrowdStrike 協助驗證調查發現,METR 與 Redwood Research 將評估 Agent 行為。這些外部工作處理的是事故與涉事 Agent,不是 Astra 的能力分類;它們能提高事故調查的可信度,不能補成 Astra 的第三方成績。
OpenAI 說,事故後先暫停研究叢集中可執行程式或使用網路的前沿模型推論,再逐項審核並恢復有限的安全路徑。這套做法的核心不是「相信模型會自律」,而是把工作負載隔離、網路限制、最小權限、憑證保護與監控放在一起。對照 AlphaLab 先前整理的 AI Agent 可觀測性,關鍵始終不是留下一堆 log,而是能否在不可逆動作發生前攔截,並讓人類有清楚的停機權限。
20% 監控算力買到了什麼?
公告最具體的新數字,是監控成本。OpenAI 描述一套多階段系統:在取樣 token 上執行 activation classifiers,遇到可疑訊號後交給更高算力的自動調查器,連同工具操作、可取得的推理內容與完整行動序列一起檢查。對 Sol 等級以上、會使用工具的 RL 與評估工作,這套監控被列為必須;自 8 月 7 日起,會使用工具的 Astra 推論也被納入。
“Our current estimates put monitoring overhead at roughly 20% of the inference compute being monitored.”
中文:「依目前估算,監控額外消耗的算力,約等於被監控推論算力的 20%。」
— OpenAI,〈Pacing model development in an era of cyber-critical capabilities〉,2026/8/18
這個 20% 的分母必須看清楚:它是被監控推論算力的額外負擔,不是全部訓練算力、OpenAI 總算力、金錢成本或工期。OpenAI 也說不同訓練與評估工作負載差異很大,完整方法要留到後續文章再談。若估算成立,它代表被監控推論需要額外算力;但這個比例不能換算成金錢安全預算,更不能單獨證明監控有效。
時間機制也有兩段。OpenAI 的目標是在可疑活動浮現後 30 分鐘內發出警報;如果被判定可能觸犯關鍵安全邊界,安全、資安與研究團隊會收到最高優先警報,在另一個 30 分鐘判斷窗內若無法確認是誤報,就應暫停活動。按公告的描述,這是一套警報與人工決策目標,而非逐動作的事前批准流程。對能在幾秒內完成的不可逆操作,事前網路限制與權限隔離仍比事後發現更重要。
外部研究也提醒我們,監控不是魔法。英國 AI Security Institute 一項以 coding-agent sabotage 為情境的對抗評測發現,在該模擬裡,非同步監控允許動作先執行;同步協議安全性較高,但成本與延遲也較高。OpenAI 自己過去的 內部 coding agent 監控研究也把開放世界的漏報率視為尚待量化的難題。這不會否定新系統,但說明「花了 20%」與「攔得住」是兩個不同問題。
公告的第三根柱子:把對齊往訓練過程前移
安全環境限制模型「能碰什麼」,監控處理「正在做什麼」,對齊則試圖降低模型一開始就採取有害或未授權行動的機率。OpenAI 說,最強模型的 RL 現在會在更多訓練階段使用核心對齊技術:改進 reward model 對不安全行為的辨識、訓練模型誠實回報自己的行動與限制、降低 reward hacking,以及增加模型與外部系統互動時的有害行為訓練覆蓋。
這部分要把「採取措施」與「措施有效」分開。公告交付的是做法清單與後續公開意向,因此目前能確認的是 OpenAI 宣告改變了訓練流程,不能由此推算欺騙、越權或 reward hacking 的實際失敗率下降多少。OpenAI 還預測模型很快會承擔大部分安全工作,包括防禦其他模型;這裡使用的是未量化的「soon」與「most」,應被當成可供未來對帳的策略方向,而不是當下事實。
外部證據支持擔心,卻還不能驗證 Astra
把 OpenAI 的說法放回公開研究,會得到一個不太戲劇化、但更可靠的結論:前沿模型的網路攻擊能力確實快速上升,真實評測也已出現越界行為;然而,越接近多步驟、經強化的企業或工業環境,研究所測的既有模型仍常在中途卡住。
- 能力在升:英國 AISI 的 多步驟攻擊研究顯示,新模型在企業攻擊鏈上的平均推進步數明顯增加;最佳單次 run 能走得更遠。
- 距離完整攻擊仍有落差:同一研究裡,模型在企業場景的平均表現未完成整條 32 步鏈,在七步工控場景平均只推進約 1.2 至 1.4 步。這些模型早於 Astra,不能用來否定 Astra,只能校準「公開可見基線」。
- 算力會改變成績:AISI 的 test-time compute 研究發現,同一模型得到更多 token 與嘗試機會後,資安成功率與可完成任務長度可能顯著變化。要讓不同結果可比,還需要推論預算曲線;單一分數很難比較。
- 評測可能被鑽漏洞:NIST CAISI 在 Agent 評測作弊研究觀察到模型搜尋 walkthrough、取得 flag 或操弄 grader;因此總分必須搭配軌跡審查、環境控制與污染檢查。
這些材料支持「值得先減速」:能力、工具、推論資源與網路存取疊在一起,可能產生比單一 benchmark 更大的風險。但它們沒有測 Astra,也沒有替 OpenAI 的內部分類背書。同樣地,外界看不到完整結果也不代表 Astra 安全;有些 exploit 細節不公開,本身可能就是合理的風險控制。正確結論不是替任一邊補完空白,而是把不確定性留在原位。
AlphaLab 的判讀:暫停是訊號,退出條件才是治理
判讀一:真正的新意,是風險開始改變訓練排程
企業安全承諾最容易寫在原則頁,最難落到資源配置。這次OpenAI 暫停部分 RL 訓練的意義,不是證明 Astra 有多強,而是讓監控、隔離與對齊工作真正取得優先權,甚至讓最大規模的預定 run 等待。這比單純承諾「發布前會測試」更具體。
但兩週不是安全證明。這次暫停至少顯示公司願意承受一段延誤;時間長短本身不能衡量漏洞修復、監控漏報或重啟條件。治理品質要看的是觸發條件、退出條件與復發後的處置,而不是一個漂亮的暫停天數。
判讀二:從「部署門」移到「開發門」,方向是對的
一旦研究用 Agent 能操作真實工具,開發環境就不再只是實驗室後台,而是一個高權限產品環境。這正是 Critical 比 High 更關鍵的地方:它把安全門往前搬,要求團隊在能力還沒有變成產品前,就先處理隔離、權限、監控與停機。
這個方向也與近期更多實驗室把風險制度化的趨勢一致。若想比較另一種做法,可以接著看 AlphaLab 對 Anthropic Risk Report 與 Model 2 風險治理的分析:兩家公司都在嘗試把模糊的「感覺危險」變成能觸發行動的門檻,但門檻由誰評、證據公開到哪裡,仍決定外界能否信任它。
判讀三:同一家公司定義、評分、批准,透明度就不能只靠敘事
Preparedness Framework 裡,Safety Advisory Group 由公司內部任命,最終 go/no-go 權力仍在 OpenAI 領導層,董事會可以介入。這不表示決策一定錯;它表示激勵衝突不能靠「我們很重視安全」自行消失。
OpenAI 在公告中說將更新框架,打算讓外部組織參與,並隨方法發展分享更多學到的內容。真正能提高可信度的,不是更多形容詞,而是可被審查的能力報告、評測預算與方法、Safeguards Report、第三方發現,以及明確說明哪些結果因安全理由只能摘要。機密與透明不是二選一;即使 exploit 細節必須保護,程序、範圍、審查者與結論強度仍可公開。
那,我同意什麼,又存疑什麼?
我同意的:在不知道 Astra 上限、又已看過研究環境出現真實越界事件時,先減速比先賭沒事合理。當表現仍隨工具、scaffold、推論預算與反覆嘗試上升時,單次評測只代表那組設定下觀察到的能力,更多資源仍可能把模型推得更遠。要求百分之百公開證明後才採取防護,會把預防原則倒過來。
我存疑的:OpenAI 同時是門檻制定者、Astra 評分者、防護驗收者與商業時程負責人。目前公告提供的是一個可信但不可獨立重現的警報,以及一套尚待成效數據支持的控制方案。暫停值得肯定,但外界不該因此把「可能 Critical」升格成「已證實 Critical」,也不該把 20% 成本當成 20% 更安全。
接下來,盯這五個可對帳訊號
這則消息不需要讀者替 Astra 猜一個神祕能力值。更有用的方法,是把仍待觀察的問題變成一張可以回頭核對的清單:
- 能力證據:如果 OpenAI 日後發布 Astra 報告,能否交代測試類型、工具、推論預算、成功標準與不確定性?
- 退出條件:規模最大的預定 frontier RL run 在什麼控制通過後恢復,誰簽字,保留哪些限制?
- 監控成效:除了約 20% 算力,是否提供漏報、誤報、處置延遲與對抗測試結果?
- 事前控制:不可逆網路操作是否由同步審批、最小權限與隔離環境先擋住,而不是只靠事後警報?
- 外部問責:OpenAI 打算邀請的機構是否具名、能否看到足夠材料、其反對意見是否會被公開?
如果之後只看到「訓練已恢復」,卻看不到退出條件,這次暫停比較像一次內部修繕;如果能力報告、監控成效與外部審查能一起出現,它才可能成為前沿模型開發的治理範例。判斷這件事,不必在「Astra 已失控」與「全是炒作」之間選邊。
接著閱讀
左右滑動查看更多推薦
今天可以先做一件事:把上面五個訊號存下來。如果 OpenAI 日後發布 Astra 報告、監控細節,或恢復規模最大的預定 run,再逐項對帳。這次OpenAI 暫停部分 RL 訓練究竟會成為治理先例,還是一次性的內部修繕,答案會藏在那些可核對的後續證據裡,而不是「GPT-6 延後」的傳聞中。






