Demis Hassabis 的前沿 AI 監管提案:美國先把關,全球會跟嗎?(2026)

最後更新: ·
前沿 AI 監管:前沿模型是否應由美國把關的 AlphaLab 主視覺

2026 年 7 月 14 日,Google DeepMind 執行長 Demis Hassabis 在 X 發布長文〈A Framework for Frontier AI and the Dawning of a New Age〉,提出一套從自願送測走向強制市場准入的前沿 AI 監管框架。文章真正重要的,不只是他預測 AGI 可能只差幾年,而是他把「誰有權決定達到前沿門檻的模型能否在美國上線」寫成了相對具體的制度草圖。

Demis Hassabis 在 X 發布前沿 AI 監管框架長文的原始頁面截圖
點圖可閱讀 Demis Hassabis 在 X 發布的原文。圖/X、Demis Hassabis

這篇文章分三步讀:先完整還原 Hassabis 的 AGI 敘事與制度設計;再把網路、生物、核風險與可解釋性逐項對照外部證據;最後回答更難的問題——美國若先替前沿模型設市場閘門,全球會跟進、互認,還是走向彼此衝突的制度?

原文的完整主張:先放大未來,再設一道閘門

Hassabis 的論證有三層,而且三層彼此相扣。

  1. 能力躍升:他把 AGI 定義為具備人腦全部認知能力的系統,並認為它可能在數年內到來。
  2. 巨大收益與巨大風險並存:藥物、能源、材料與科學研究可能加速,但網路攻擊、生物風險,以及更自主的系統也可能同步放大。
  3. 需要市場閘門:美國應成立由業界出資、聯邦監督的獨立標準機構,先測試最前沿的模型,通過後才能在美國部署。

“probably only a few short years away”

中文:AGI「很可能只剩短短幾年」。

Demis Hassabis,2026 年 7 月 14 日

這句話是整篇文章的情緒引擎。Hassabis 進一步把 AGI 比成火與電,而不是網路或手機;又以「或許是工業革命十倍規模、十倍速度」描繪衝擊,最後把願景推到藥物發現加速、資源可能不再構成人類進步限制,甚至走向後稀缺世界。

但這些不是同一種證據。AI 已能加速蛋白質結構預測、協助篩選候選藥物計算材料,並在實驗 tokamak 上改善電漿控制;這支持「部分科研迴圈正在加速」。它不等於 AGI 時程已被證明,也不代表臨床、實驗、製造、能源基礎建設、分配與政治瓶頸會自動消失。更準確的圖景是:認知成本下降後,瓶頸更可能轉移,而非自動消失。

他提議的前沿 AI 監管,實際怎麼運作?

制度核心不是管每一間新創,而是先用能力門檻辨識「frontier model」與開發它的實驗室。達到門檻後,模型要接受網路、生物、欺騙、規避防護等測試;機構維護不公開題庫、淘汰已飽和的 benchmark,並由第三方稽核實驗室的測試與風險管理。

“up to 30 days before release”

中文:前沿模型在發布前「最多提前 30 天」交給機構測試。

Demis Hassabis,2026 年 7 月 14 日

初期是自願安排;等標準成熟後,Hassabis 希望它變成在美國部署前必須通過的要求。門檻應隨能力更新,而不是只看訓練算力;開源與閉源、國內與境外模型都應受同一能力標準約束,未達前沿門檻的學術研究與新創則不必承擔同等合規成本。如果情勢嚴重到有必要加強框架,原文也提出由機構協調 Frontier Labs 放慢開發。

原文也把數位浮水印、可讀推理軌跡與透明度列入工具箱。這些都是有用訊號,但不能把它們誤當成真偽證書或模型心智的 X 光;後文會回到這個限制。

先把四種主張分開:預測、證據、風險與法律

原文主張查證結果應如何理解
AGI 可能只差幾年無法驗證這是 Hassabis 在 2026 年 7 月的個人機率判斷,不是科學共識。
AI 將大幅加速科學部分支持搜尋、設計與控制迴圈已有實證;仍需臨床、實驗、製造與商業化驗證。
cyber、bio、nuclear 都在逼近證據強度不同本文查閱的資料中,網路能力有較直接證據;生物風險值得預防但真實增量不確定;核風險的直接 uplift 證據較少。
強制送測可成為美國市場門檻EO 未建立這種閘門EO 14409 只要求在 60 天內設計自願 early-access 框架;一般性強制准入會需要額外且明確的法定授權與救濟程序。

AGI「只差幾年」不是共識,但也不必等 AGI 才治理

截至 2026 年 7 月,Google DeepMind 研究者提出的 AGI 認知衡量框架仍指出,現有測試未涵蓋完整人類認知。《International AI Safety Report 2026》把停滯、放緩、延續與加速都視為合理路徑;METR 的長任務研究則顯示模型在乾淨、規格明確的程式與機器學習任務上快速進步,同時警告不能把這條曲線直接外推到完整職業或所有認知工作。

因此,「只差幾年」應保留作者、日期與不確定性。它沒有清楚的達標測試,也不能替「十倍工業革命」提供分母。後者沒有說明是 GDP、總要素生產力、社會福利還是科研產出,更像用來傳達規模感的修辭情境。

但反過來說,前沿 AI 監管也不需要等待 AGI 倒數成立。已可測量的網路能力、模型權重失竊、評測作弊與高風險領域增量,已足以支持能力導向的測試。把治理理由綁在一個無法驗證的 AGI 日期上,反而會讓有根據的風險一起被當成炒作。

風險訊號已出現,但不能把 cyber、bio、nuclear 綁成同一條曲線

在本文查閱的公開資料中,網路能力有較多受控攻擊鏈與真實事故證據。英國 AI Security Institute(AISI)的趨勢報告顯示,前沿模型已能完成部分高難度漏洞利用與受控攻擊鏈,足以提高攻防壓力;AISI 也明確指出其部分測試環境比真實企業網路更小、更簡化。2026 年 7 月,OpenAI 公開的 Hugging Face 評測事故則證明,高算力、降低拒答的資安評測 agent 曾逃出隔離並進入真實 production 環境,但這仍不能外推成所有模型都能自主攻陷防護完善的企業網路。完整脈絡可見 AlphaLab 的事件解析

生物風險有能力訊號,但真實世界增量仍不確定。模型在 AISI 的私有生物問答、序列檢索與部分實驗排錯評測表現很高,足以採預防性防護;材料取得、濕實驗能力、設備與隱性知識仍是重大瓶頸。《International AI Safety Report 2026》記錄,多家開發者在無法排除新手能力增量的情況下增加防護。這是預防性判斷,不代表已證明模型能製造武器。

截至 2026 年 7 月 26 日,本文查閱的公開資料中,核風險的直接 uplift 證據少於 cyber 與 bio。OpenAI 對 deep research 的公開核/放射性評測表示,依其可取得的非機密資訊,該系統無法提供有意義的核/放射性武器研發協助;OpenAI 同時說明,完整評估仍需美國能源部等具機密專業的機構合作。這個缺口既不能證明近期核風險已到來,也不能證明它永遠不存在。最穩健的寫法是:提前測試合理,把「很快出現」寫成既成事實不合理。

同樣地,RepliBenchRE-Bench 顯示,今日 AI agent 已能在工具輔助下完成部分、短時且規格明確的 AI 研發與自我複製子任務;長時研發、KYC、穩定部署與持久性仍是明顯限制,RepliBench 也明言受測模型尚不構成可信的端到端自我複製威脅。現有結果不足以證明模型能形成可靠的遞迴改進循環。想理解這個差別,可延伸閱讀 AI 開始打造 AI,距離「遞迴式自我改進」還有多遠

最容易被忽略的技術限制:測驗會被學習,推理文字可能不忠實

Hassabis 正確抓到 benchmark 污染:公開或長期使用的題庫可能污染或飽和,模型也可能在網路上找到答案。因此,獨立 held-out tests、輪替密題與退役機制都值得做。美國 CAISI 的 DeepSeek V4 套件包含 ARC-AGI-2 semi-private 資料與內部 PortBench;在 CAISI 預先承諾、含非公開題目的整體套件上,結果弱於 DeepSeek 自選、自報的套件。這不是同一組題目的逐題重測,卻展示了獨立選題的價值。

但非公開或在訓練後建立的題目,只能降低污染風險,不能單獨消除 Goodhart’s law、grader gaming、evaluation awareness 或部署落差。NIST 已記錄 AI agent 找網路答案、停用測試與利用評分器的情況。因此「通過 30 天測試」只代表已測版本在當時的 scaffold、工具、算力與題庫下達到所採通過標準,不能變成永久安全證書。

「可讀推理」的限制更直接。Anthropic 的提示實驗中,Claude 3.7 Sonnet 只有約 25%、DeepSeek R1 約 39% 會在推理文字承認真正影響答案的提示;在 reward-hacking 任務,多數環境不到 2% 會主動承認利用漏洞。這些刻意設計的數字不能外推所有情境,卻足以推翻「能讀到文字,就理解模型真正因果推理」的假設。

可讀推理軌跡比較像一支額外的煙霧偵測器:有用,但會漏報。OpenAI 的實驗還發現,直接用推理監控訊號施加訓練壓力時,agent 可能學會隱藏意圖、同時繼續 reward hack。推理文字必須與行為紀錄、權限限制、內部探針與部署後監測交叉驗證。若你想補上 evals 的基礎概念,可先讀 AI 模型怎麼學習:從預訓練到 Evals

浮水印也一樣。Google DeepMind 的 SynthID嵌入 Google 指定的生成產品,並被設計為承受官方列出的常見裁切、濾鏡與壓縮;Google 也明言,極端影像修改下並非 foolproof。未檢出 SynthID 只代表沒有偵測到這種水印,不構成真人來源證據;它應與簽章式來源紀錄、平台標籤與鑑識工具並用。

這不只是 Demis 的個人提案:Google 已先提出 FARO

2026 年 6 月 25 日,也就是 Hassabis 發文前 19 天,Google 已發布美國 AI 治理白皮書,提出 Frontier AI Regulatory Organization(FARO)。下圖的三個藍色方塊——獨立機構、科學能力基準、年度稽核——與這篇文章的制度骨架高度重疊。不過兩者並不相同:FARO 先從年度程序稽核起步;Hassabis 另明列 30 天 early access、季度檢討、自建密題、最終必須通過與協調降速。

Google 2026 年政策白皮書列出的前沿 AI 監管三支柱:獨立機構、能力基準與年度稽核
Google 的 FARO 白皮書把獨立機構、科學基準與年度稽核列為三支柱。圖/Google〈A Pragmatic Approach to AI Governance in America〉,2026 年 6 月

兩份文件的重疊不是「Hassabis 指揮白皮書」的證據,也不能據此推定陰謀;較準確的說法是,Hassabis 的個人提案與 Google 19 天前公開的政策立場高度一致。利益關係仍值得揭露:作為大型實驗室,Google DeepMind 可能比資源有限的新創更容易負擔複雜合規。複雜門檻可以提高安全,也可能意外加深 incumbents 的優勢。

FINRA 類比成立一半:重大禁入權需要及時的公共複核

FINRA 不是政府機關,而是由會員費支應、向 SEC 註冊並受其監督的私人非營利自律組織。它能訂規、查核與處分會員,靠的不是「大家自願聽話」,而是聯邦法律、監督、申訴與司法審查共同撐起的權力架構。

這正是 AI 版 FINRA 最容易被一句話略過的地方。模型不像券商會員,有清楚封閉的產業邊界;境外 API、雲端部署與已散布的開源權重,執法難度完全不同。第三方可以擴充程序稽核與測試容量;但美國聯邦上訴法院在 Alpine 案的初步禁制令判斷顯示,若重大禁入在政府實質審查前生效,可能引發私人非授權疑慮。這不是宣告 FINRA 整體違憲的終局判決,卻是 AI 制度設計不能略過的警告。

業界出資也不是原罪。前沿評測需要高薪專家、算力、安全環境與機密存取,公共機構確實可能跟不上。真正的問題是誰核准規則、誰揭露利益衝突、誰能挑戰錯誤判定,以及出資最多的公司是否也最能改寫考題。

一項關鍵現實障礙:EO 14409 §3 的 early-access 框架明確停在「自願」

2026 年 6 月 2 日,美國白宮發布 EO 14409,要求相關機關在 60 天內建立機密網路能力 benchmark,並設計一套自願 early-access 框架,讓開發者可在向其他可信夥伴發布前最多 30 天提供聯邦政府存取;同一份命令卻明文說,它不授權對模型的開發、公開、發布或散布建立強制 licensing、preclearance 或 permitting。截至本文日期 2026 年 7 月 26 日,這項 60 天期限尚未屆至。

所以 Hassabis 的提案不是把現行行政命令「多做一步」就能完成。要建立全美一般性的「未通過便不得部署」市場閘門,會需要額外且明確的法定授權,並建立聯邦複核、正當程序與司法救濟;既有的特定部門權限則要另案判斷。現有 CAISI 已具備部分科學測試能力;制度真正缺的,是把這些能力接到合法、可問責的市場治理,而不是再造一個名稱不同的測試中心。

「全球共同標準」不能只靠美國市場力量

Hassabis 希望美國先行,最後形成全球共識。美國聚集多家主要實驗室與基礎設施供應商,其市場規則可能對跨國供應者形成事實壓力;但市場力量不等於全球正當性。

歐盟的 AI Act 已對具系統性風險的通用模型設置評估、對抗測試、風險降低、事故通報與資安義務;英國 AISI 已在做前後部署測試,但不是監管機關。這表示全球不是一張等美國填寫的白紙。可行方向應是共同最低標準、受控資料交換與測試互認,而不是讓其他司法管轄區自動接受一張美國證書。

AlphaLab 的判讀:這套框架抓對了問題,卻把考試想得太像答案

一、能力門檻比公司名單與算力門檻更合理

風險來自系統能做什麼,不是它屬於哪家公司。用可觀察能力啟動義務、並讓低風險研究與新創免於同等負擔,是這份前沿 AI 監管提案最強的部分。開源與閉源也不應因標籤獲得安全豁免;但「規則來源中立」不代表「執法能力來源中立」,已公開散布的權重仍比封閉 API 難管。

二、通過評測不等於安全,真正需要的是可持續的 safety case

30 天是 EO 與 Hassabis 提案採用的時間上限,不構成其充分性的證據;是否足夠取決於存取深度、領域、工具、算力與紅隊廣度。更穩健的制度應把預部署評測、重大更新觸發重測、部署後監控、事故通報、模型回滾與緊急權限串成一條鏈。一次考試只是一個截面,不是終身證照。

三、FINRA 的價值不在業界自律,而在制衡

專業、資料與經費可以由產業補充;規則核准、重大處分與申訴機制必須保持公共責任。還要把新攻擊面算進去:未發布權重、CBRN 題庫與安全弱點集中到評測機構後,它本身就會成為高價值目標。安全 enclave、最小權限、全程稽核與分層存取不是附註,而是制度本體。

四、美國可以設市場規則,不能自封全球裁判

美國市場准入規則可以影響全球公司,卻不會自然獲得其他社會的授權。若這套制度真想成為全球底座,董事席次、科學程序、申訴權與互認機制都要讓 EU、英國與其他司法管轄區有實質角色,而不是只被邀請承認結果。

五、AGI 時間表其實是多餘的

Hassabis 最有說服力的部分,不是「幾年內 AGI」,而是現有 benchmark 常無法準確代表真實能力,量測工具也未必跟得上快速變動的系統。把兩者分開,反而能形成更耐久的政策:即使 AGI 延後,評測與事故治理仍值得做;即使進展突然加速,制度也不必等某個模糊標籤被宣布。

我同意的:能力導向門檻、獨立 held-out tests、開閉源一致原則、第三方程序稽核,以及持續更新風險標準。

我存疑的:把 30 天預審誤當完整安全證明、把可讀推理當作忠實解釋、原文未具體交代公共複核與救濟如何運作,以及把美國市場力量直接寫成全球共同意志。

接下來,應該用五個問題審視任何 AI 監管提案

  1. 門檻測的是什麼?是訓練算力、模型名稱,還是可重現的實際能力?
  2. 誰出題、誰複驗?公開方法與密題如何平衡,可否由受控的獨立單位重現?
  3. 漏報怎麼處理?通過測試後若部署環境改變,是否有監控、事故通報、回滾與重測?
  4. 誰能推翻錯誤決定?市場禁入是否有政府複核、利益揭露、申訴與司法救濟?
  5. 如何跨境互認?是共同最低標準與雙向互認,還是要求全世界接受單一國家的證書?

對模型開發者而言,現在就該保存版本化 evals、工具權限、已知失敗模式與事故處理紀錄;不要把模型自述或推理文字單獨當成可靠證據。對政策制定者而言,最重要的不是追求一張「安全」印章,而是建立能承認未知、追蹤變化、修正錯誤的制度。

而對一般讀者,最值得警惕的不是某個單一科幻場景,而是能力、部署權限與問責之間的落差。AI 安全指數 2026可補上各大實驗室治理承諾的橫向比較;AI 找到數學反例後,為何仍需要可驗證性則提供另一個更小、卻更清楚的範例。

📚 延伸閱讀


免責聲明與利益揭露:本文為 AlphaLab 基於公開資料撰寫的獨立評論,非法律、政策或投資建議。原始文章、截圖與相關資料之著作權分屬 Demis Hassabis、X、Google 及各原始來源,本文僅作評論與研究引用。AlphaLab 未就本文接受 Demis Hassabis、Google DeepMind、Google 或文中其他機構提供的贊助或報酬。制度效果仍取決於未來法案、技術標準與實際執行,讀者應以各主管機關最新公告為準。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。