2026 年 9 月 12 日,Anthropic 執行長 Dario Amodei 在 X 宣布新文,並於個人網站公開〈We Must Pace the Frontier〉,把 AI 減速從風險警告推進到一項公司未來式承諾:Anthropic 將邀請外部評估團隊取得持續、類員工的內部存取權。接下來不到九小時內,Elon Musk、Sam Altman 與 Demis Hassabis 接連響應,說的卻不是同一件事。

以美東時間計算,四位領導人的貼文從上午 10:01 到傍晚 6:59,前後約 8 小時 59 分。這是四名領導人的快速方向性收斂,不是四家公司共同簽下減速協議。這篇文章先還原這九小時,再逐句比對四種表態的分量,最後把「認同」轉成未來可核對的治理里程碑。
如果你想看 Dario 三階段方案、AI 資安事故與反壟斷難題的完整拆解,可先讀 AlphaLab 的前一篇深度分析;這一篇只處理一個新問題:四位領導人在這九小時內究竟承諾了什麼。
8 小時 59 分:一場 AI 領袖連鎖表態
Dario 的核心句很直接:
We must slow the pace at which we improve the capabilities of AI models.
中文:我們必須放慢提升 AI 模型能力的速度。
Dario Amodei,〈We Must Pace the Frontier〉
他的 pacing 並非停止訓練;原文特別澄清「pacing does not mean halting model training or technical progress」。主張是讓能力提升的節奏慢一些,把多出的時間投入對齊、可解釋性、營運安全與第三方驗證。方案是三條不必依序推進的路徑:Anthropic 單方面承諾嵌入式外部評估;民主國家的實驗室協調安全標準與推進邊界;以及更難驗證的全球協調。
促使 Dario 改變過去反對減速立場的,是兩項發展:AI 開始更深地參與下一代 AI 的研發,以及近期 agent 對齊事故顯示更強系統可能放大損害。他要的不是把時間空白留著,而是拿來改善訓練與部署的營運品質、alignment、interpretability 和 evaluation。
原文後半也承認協調難度逐層升高:民主國家內的 pacing 需要政府支持,且會被美中能力差距約束;全球方案則從限制生物武器等狹窄危險用途、發布前風險測試,一路排到 recursive self-improvement 的速度上限與完整 pause。Dario 支持把完整暫停放上桌討論,卻判斷它短期內很難實現。
接著出現連鎖反應:Elon Musk 約一小時後寫下「Dario is right」;Sam Altman 又在 12:30 表示 OpenAI 也會提供類員工存取;Demis Hassabis 則在 18:59 支持方向,同時保留「細節仍需處理」。
四則表態,其實只有兩項公司承諾
| 人物/公司 | 公開動作 | 這則訊息支持的結論 | 下一個可驗證里程碑 |
|---|---|---|---|
| Dario Amodei/Anthropic | 提案+公司未來式承諾 | 主張放慢前沿能力提升;Anthropic 將邀請外部團隊取得持續、類員工存取權,權限大致比照內部風險評估人員 | 具名評估機構、公開章程、生效日與首份報告 |
| Elon Musk/SpaceXAI(原 xAI) | 三字背書 | Musk 以「Dario is right」停在個人方向性背書 | SpaceXAI 的正式政策、措施或時程 |
| Sam Altman/OpenAI | 原則認同+公司承諾 | 認同需要 pace the frontier;OpenAI 也會給獨立評估者類員工存取權 | 評估者、範圍、開始日期、發表與解任條款 |
| Demis Hassabis/Google DeepMind | 有保留的方向支持 | 認為路徑與方向正確,但細節仍待處理;並指向另一套產業標準機構構想 | 把支持轉成公司政策或具權責的共同機制 |
表格刻意不替四人排「誠意高低」。我們能核對的是 speech act:誰提出方案、誰只背書、誰代表公司承諾一項措施、誰附帶保留條件。這比把四則貼文壓成「四家公司同意 AI 減速」更接近事實。
Committing to having independent evaluators with employee-like access is a great idea, and we will do the same. We’ll have more to share soon.
中文:承諾讓獨立評估者取得類員工存取權是個好主意,我們也會這麼做;更多細節稍後公布。
Sam Altman,X 貼文
Sam 還自述,pacing 已是 OpenAI 最近數週的主要討論之一;他也明確讓公司背上一項可追蹤的承諾,但文字只對齊「獨立評估者+類員工存取」這個核心。Anthropic 原文談到的持續安排、權限例外、發表自主性、刪節邊界與揭露權,不能自動套到 OpenAI 身上。
Dario’s essay points towards the right path forward. The details need working through, but the direction is correct for meeting this critical moment.
中文:Dario 的文章指向正確路徑;細節仍需處理,但方向適合回應這個關鍵時刻。
Demis Hassabis,X 貼文
Demis 的保留語很重要。他連結的是自己提出的產業標準機構方案:由政府監督、公私協作,初期讓前沿實驗室在模型發布前最多 30 天自願分享並接受測試,若制度證明可靠,未來才可能轉成強制要求。這與 Dario 的公司內部持續評估者可以互補,卻不是同一套制度。
真正收斂的是問題意識,不是共同政策
四則貼文被放進同一個 pacing 敘事,最低共同點其實只是公開支持 Dario 指出的方向。Dario 明說要放慢能力提升;Sam 明說 OpenAI 需要 pace the frontier;Musk 停在個人方向性背書;Demis 認為路徑正確但保留細節,並把方向接到跨公司標準機構。這是值得注意的問題意識收斂,尚不足以證明四家公司接受同一套結構性診斷。
因此,這次事件的強訊號是議程收斂,不是訓練速度、算力上限或模型發布日已出現共同規則。領導人貼文可以改變公開討論,真正的公司治理則需要政策、權限、紀錄與後果。
Anthropic 給了條款草圖,OpenAI 先給方向
Anthropic 的承諾較具體,但仍是待落地的設計。Dario 的 X 摘要用了「永久、員工等級」的字眼;操作文章則說,公司預計近期邀請團隊加入這項安排,提供辦公桌、識別證與筆電,權限大致比照內部風險評估人員。任務包括核驗安全承諾、回報事件,以及評估已完成模型和訓練管線或流程;法律義務、合約限制及客戶或合作夥伴隱私會形成例外。
Dario 承諾,未來合約會讓評估者在不受 Anthropic 編輯控制下,發布關於風險、事件、安全實務,以及獲准或遭拒存取範圍的關鍵發現;可要求刪節的範圍限於資安敏感、受法律特權保護、商業敏感或第三方機密內容,不能只因結論不利而刪,評估者也可公開說明重要刪節的影響。這些是承諾中的未來條款,不是已完成的評估制度。
Sam 的貼文只承諾「獨立評估者+類員工存取」,把機構、範圍、時程與發表條款留到稍後。兩家公司過去早有外部模型測試:美國 NIST 在 2024 年公告可於發布前後接觸兩家的新模型,OpenAI 也曾公開早期 checkpoint 與較少防護版本的受邀評估安排;其 2025 年公開條款仍要求發表前接受書面審閱與核准,以處理保密與準確性問題。Anthropic 明說會持續存取,Sam 沒有說期限;OpenAI 是否也會走向組織流程與事故證據的持續接觸,仍要由正式條款回答。
因此,讀「employee-like access」時要拆成三層:Access 是看得到什麼,Independence 是誰任命、付費與解任,Authority 則是發現問題後能否改變決策。英國 AISI 的官方經驗也提醒,第三方評估提供的是能力與漏洞快照,評估科學仍不足以把一次結果當成安全認證。
Dario 對 6 到 12 個月後 agent swarm 可能具備接管整個網路能力的說法,同樣要放回正確層級:原文用「my worry」描述一項條件式情境擔憂,不是帶有機率與攻防模型的實測時間表。英國 NCSC 在 2026 年 7 月仍表示,真實世界的完整入侵生命週期需要人類判斷。這個落差不等於風險可忽略,而是提醒讀者把「應該準備」和「已證明會在期限內發生」分開。相關事故數字可到Anthropic AI 網攻報告查核繼續核對。
AlphaLab 的判斷:議程已轉向,治理仍要交卷
我同意什麼
第一,四位競爭者在不到九小時內公開靠攏,確實改變了 AI 減速議題的產業分量。第二,Anthropic 若把外部評估從發布前的專案合作擴展到持續、接近內部流程的存取,第三方就可能看見模型卡以外的事故、權衡與執行落差。第三,Anthropic 對發表自主與刪節邊界給出可日後對帳的原則,這比籠統地宣稱「重視安全」更有資訊量。
我存疑什麼
第一,四人朝同一方向表態,不代表他們接受同一套速度指標或觸發條件。第二,OpenAI 承諾了核心方向,細節仍由「稍後公布」承接,不能先替它補上持續性、發表與刪節條款。第三,持續評估改善的是可見度;要真正形成煞車,仍需要外部可核對的門檻、決策者、處置與重啟條件。
所以,現有證據不足以把這稱為已完成的安全協議,也不足以判定四則表態都只是公關。它比較像一張公開支票:Dario 寫下較完整的條款草圖,Sam 簽了核心金額,Musk 與 Demis 則表示方向值得走。支票是否兌現,要看接下來出現的是章程與報告,還是更多貼文。
下一則聲明,先圈出三個動詞
- agree/支持:證明說話者接受方向,不自動代表公司措施。
- will/將會:形成可追蹤承諾,但仍要找清楚主體、範圍與日期。
- has/已完成:要求章程、具名評估者、存取規格或公開報告來佐證執行。
這個讀法也解釋了九小時事件的真實分量:四則公開表態很重要,Anthropic 與 OpenAI 的 will 更重要;真正決定 AI 減速是否成為治理制度的,會是未來可被查驗的 has。
接著閱讀
左右滑動查看更多推薦
下一次看到「另一位 CEO 也同意」時,先回到原始貼文,分清楚個人背書、公司承諾與已執行制度;這三者的治理分量完全不同。
