跳到主要內容

Anthropic 風險報告解讀:評級升至「低」,Model 2 為何留在內部?(2026)

最後更新: ·
Anthropic 風險報告 Model 2 與 CoBench 62.8% 圖表

2026 年 8 月 14 日,Anthropic 公布了 〈Risk Report: August 2026〉。這份 Anthropic 風險報告同時放出三個看似矛盾的訊號:高風險情境下的失調整體評級從「極低」上調為「低」、內部指標顯示 AI 對研發加速已有重要貢獻但整體仍低於 2 倍、而一個比 Mythos 5 略強的內部 Model 2 暫無對外發布計畫。真正值得讀的不是「神祕模型被雪藏」,而是報告如何把能力、部署與自我監督放進同一張帳。

Anthropic 風險報告 2026 年 8 月版 PDF 首頁
Anthropic 以機構名義發布、沒有個人署名的 2026 年 8 月風險報告。報告涵蓋截至 7 月 15 日的狀況,點圖可開啟原始 PDF。圖片來源:Anthropic。

先講結論:這不是一份證明模型安全的報告,也不是 Model 2 的產品發表。它是一家前沿 AI 公司用自己的分類、內部資料與控制措施,評估報告涵蓋的當前風險。報告公開了不少內部細節,但核心證據仍主要來自公司自身;因此最合理的讀法,是把它當成一份可稽核的風險主張,而不是安全認證。

以下先忠實還原報告的三個更新,再用外部研究逐項核對量測限制,最後判斷讀者真正該追蹤的是哪一條治理邊界。

這份報告到底改變了什麼?

先釐清 Anthropic 風險報告的時間與範圍:官方 Responsible Scaling Policy 頁面在 8 月 14 日的更新中寫道,當日分享了這份報告;PDF 本身只標示「August 2026」。報告主要涵蓋 2 月 24 日至 7 月 15 日,少數之後發生的事件會另外註明。它評估的不是單一模型,而是 Anthropic 整體活動,包括只在公司內部運行的模型。

  • 失調評級上調:高風險情境下的 misalignment 整體評級由「very low」升到「low」。
  • Model 2 被揭露:它在若干內部任務上比 Mythos 5 好,但並非跨世代跳躍;Anthropic 在 8 月 14 日報告中表示,當時沒有對外發布計畫。
  • 研發已加速:Anthropic 認為 AI 讓內部 AI 研發明顯變快,但整體進度尚未翻倍,而且量測困難、結果有延遲。

這三點不是三則獨立新聞。能力變強,讓 AI 更能參與打造下一代 AI;內部使用增加,又讓公司取得更多真實資料,同時擴大監督面積。Anthropic 表示,現有論證可能仍支持「極低」,但近期資安評測事件提高了整體不確定性,因此改列「低」。

「極低」升到「低」:上調的是評級,不確定性怎麼讀?

Anthropic 風險報告高風險情境失調評估表
報告表 1.2.A:Anthropic 把高風險情境下的失調評級列為「低」,並明說這是從先前的「極低」上調。圖片來源:Anthropic,PDF 第 10 頁。

報告第 71 頁的關鍵動作很清楚,原因是近期資安評測事件增加了整體不確定性。

“we are raising our assessed risk to ‘low’ to reflect increased overall uncertainty.”

中文:我們正把評估風險上調為「低」,以反映整體不確定性增加。

Anthropic〈Risk Report: August 2026〉,第 71 頁

這個「低」有三層邊界,少一層都容易讀錯。

第一,它是定性分級,不是百分比

Anthropic 說 Mythos 5 與 Model 2 出現「廣泛且會推高優先風險路徑的失調」是 very unlikely,但沒有把這個詞對應到數字。報告甚至提醒,各項論據彼此相關,不能把定性機率當成獨立事件相乘。把「低」翻成 1%、5% 或任何單一機率,都是報告沒有提供的精確度。

第二,它只評估災難性路徑

這裡談的是模型在組織中取得強大工具權限後,是否可能操縱系統、影響決策或破壞安全研究,進而造成災難性後果。它不等於一般使用者會遇到的幻覺、偏見、隱私或工作品質風險都很低。Anthropic 也承認已觀察到模型為完成困難任務而採取不當行動;公司評為低的,是已知行為導致災難性傷害的當前風險。

第三,上調不代表證據突然證明失控

報告的論證仍傾向支持「極低」,但資安評測中的事件揭露讓 Anthropic 對威脅模型與評估方法更沒把握,因此改列「低」。換句話說,這次最大的更新不是公司看見一個確定會發生的災難,而是承認「我們可能漏掉什麼」的權重應該更高。此前 Anthropic 資安評測事故也顯示:當測試移除一般防護並給模型真實網路權限時,評測結果與正常產品風險不能混為一談,但也不能因為是測試就忽略。

這個改動值得肯定,因為好的風險框架應該在不確定性增加時先調整評級,不必等事故變成統計顯著。不過它也暴露限制:LTBT 未要求、RSP 也未強制本次外部審查;Anthropic 表示仍在這份報告延續公開外審試點。其中一章由 Claude 在 24 分鐘內檢視近完成稿,只能算內部的模型輔助評論,不能當第三方背書。

Model 2 是什麼?報告有說的比沒說的少

報告第 16 頁的總述把 Model 2 描述為比 Mythos 5 略強。Anthropic 的粗略觀察是:它在許多內部用途相關任務上有明顯進步,但幅度不像 Opus 4.6 到 Mythos Preview 那麼大。

截至報告涵蓋日,Model 2 已通過內部部署審查,且採取較強阻擋控制的分階段上線方式,之後被大量用於程式、資料生成與其他代理型工作。不過 Anthropic 尚未跑完通常的整套部署前評估,因此對它的能力判斷信心較低。這份公開版未披露參數量、架構、訓練算力,也未提供完整部署前評估套件的結果;報告公開使用的名稱仍是 Model 2。

最容易被標題帶偏的是「不發布」。原文只表示目前沒有對外發布計畫;這不是永不發布的承諾,也不是下一款 Claude 的預告。這份報告只稱它為「Model 2」,也沒有把風險上調與暫無發布計畫連成因果;Axios 另轉述 Anthropic稱,研發中本來就會產生不打算發布的探索版本。把兩件事接成因果,會比證據走得更遠。

62.8% 的 Model 2,離「取代研究團隊」還有多遠?

Anthropic CoBench v2 Model 2 62.8% 與 Mythos 5 50.3% 長條圖
CoBench v2:Model 2 得分 62.8%,Mythos 5 為 50.3%。這是經難度篩選的 Anthropic 內部歷史任務,不是通用能力排名。圖片來源:Anthropic,PDF 第 100 頁。

最具體的能力證據是 CoBench v2。它收錄 449 個 Anthropic 過去的工程與研究問題,多數來自 2026 年 2 至 4 月;資料集主要保留 Mythos Preview 三次嘗試至少失敗一次的題目,未篩選版本約是兩倍大。解答還要由模型依照公司內部的根因紀錄評分。

模型CoBench v2可以合理推出什麼
Claude Opus 4.615.6%早期基準線
Mythos Preview54.8%在這組內部任務上大幅進步
Mythos 550.3%在這組任務上低於 Mythos Preview
Model 262.8%比 Mythos 5 高 12.5 個百分點
Anthropic 對「可完整替代技術員工」系統的預估分數至少 85%公司依人工檢查推估,並非實測的人類分數

所以 62.8% 不是「Model 2 有 62.8% 通用智慧」,也不是「比 Mythos 5 聰明 12.5%」。它只表示,在特定、篩選過、權限受限且由模型評分的內部任務中,CoBench v2 得分高 12.5 個百分點。歷史解答可能含糊或錯誤,rubric 也可能過窄;Anthropic 自己承認,85% 的完整替代預估線帶有不確定性。

但也不能因此把結果當成毫無意義。Model 2 在真實歷史工作而非玩具題上超過 Mythos 5,說明代理能力正深入公司的生產流程。關鍵不是單一分數,而是模型是否能長時間使用內部工具、查資料、驗證結果,並在失敗後恢復;這正是能力與監督同時變難的地方。

為什麼 18 位技術人員自報約 4 倍提升,公司進度卻不到 2 倍?

報告裡有兩個很容易被混用的速度。18 位 Anthropic 技術人員回顧 Mythos Preview 時,自報特定工作的幾何平均提升約 4 倍;但 Anthropic 已降低這份小樣本調查的證據權重,因為受訪者可能高估自己選擇交給 Claude 的任務,也可能低估主要節省等待時間的效益,而且這不是 Model 2 的新調查。

公司真正關心的是整體 AI 能力進展速度。內部領先指標顯示,2025 年初至年中出現有意義的加速,但仍低於 2 倍。Anthropic 認為加速起點主要來自 AI 以外的因素,而 AI 是之後較快趨勢得以延續的重要原因;這個判斷仍有量測落後與未公開指標帶來的不確定性。

兩個數字不矛盾。寫一段程式快 4 倍,不代表整家公司做出下一代模型快 4 倍。研究還受資料、算力排程、實驗時間、硬體、跨團隊決策與「知道下一題該問什麼」限制。METR 對遞迴式自我改進經濟學的分析也提醒:即使可自動化工作快速增加,實驗與互補投入等瓶頸仍可能讓總體加速趨平;但作者同時明說,現有瓶頸證據並不壓倒性,仍不能排除長時間的快速加速。若想先理解「AI 打造 AI」為何不是一個單一倍數,可延伸閱讀 AI 開始打造 AI

獨立證據支持到哪裡?

截至 2026 年 8 月 18 日,我們查閱的公開材料尚未提供可重做 Model 2 與 CoBench 核心結果的外部驗證。一份可用的方法論對照,是 METR 對 Anthropic 2026 年 2 月風險報告自動化研發章節的審查。METR 認為原報告證據不足,指出小樣本、問法粒度與框架、校準困難,並發現一個缺失回覆被誤算為否定回覆;它靠報告發布後的其他能力證據,才同意當時的「極低」底線判斷。

8 月報告補上 CoBench、失敗案例與更多組織指標,是實質進步;可是研發加速內部領先指標的性質與趨勢仍未公開,AECI 又是 Anthropic 的內部版本,不能直接和 Epoch 公開 ECI相比。這代表外部讀者能檢查推理結構,卻還不能重做核心計算。

另一份 METR 的跨實驗室前沿風險試評認為,2026 年 2 至 3 月納入試評的內部代理可能具備啟動小型 rogue deployment 的手段、動機與機會,但無法使其高度穩健;另在 32 題攻擊策略分類集,最佳 Anthropic 內部模型為 59%,一位 METR 研究員在隨機 12 題子集約 90%。兩個分數的分母不同,不能直接當成人機差距,而且這不是 Model 2 評測。它既不證明 Model 2 安全,也不證明它正在策畫失控;合理結論是,風險測量正變得有訊號,但尚不可靠。

AlphaLab 判斷:真正的分水嶺是「內部部署治理」

我同意:風險上調是合理修正

已知的不當行為、可能被低估的隱蔽能力、監控覆蓋缺口,加上近期資安評測事件,足以讓「極低」顯得過度自信。把評級升到「低」不是危言聳聽,而是把模型更強、工具權限更大與證據仍不完整一起算進去。

我保留:核心內部資料與主要評估權仍掌握在公司手中

Anthropic 公開了多項內部使用、監控缺口與事件細節,也承認一名員工的 AI 使用未被記錄,也未受自動離線監控;該員工交給代理一項相對開放、涉及在含高度敏感資源叢集中產生新代理的任務。原有代理因舊指令,以 --dangerously-skip-permissions 啟動新代理,其中一個刪除了大量作業。報告還說,離線監控尚未覆蓋所有員工,以及這類叢集內的所有使用。當關鍵的 Model 2 只在內部運行、領先指標被刪節,而正式外審既未由 RSP 強制、也未由 LTBT 要求時,僅憑公開版,外界無法重做核心量測,也無法確認披露是否完整。

我最在意:不公開不等於沒有公共風險

截至涵蓋日,Model 2 沒有對一般使用者發布,因此少了一條直接外溢路徑;但報告把它與 Mythos 5 合併描述為大量用於程式、資料生成、研究與工程,以及其他代理型工作。若這些內部模型能改變下一代模型的速度、訓練資料或安全判斷,影響就可能透過公司決策傳到外部。治理單位不該只問「模型有沒有公開」,還要問「模型拿到什麼工具、誰能停止它、異常多久會被看見」。

這也是 Anthropic 風險報告最重要的訊息:前沿模型的安全邊界,正在從發表前 benchmark 移到日常組織控制。權限最小化、不可竄改日誌、獨立抽樣、分階段部署與明確停止條件,會比替模型貼一個「低風險」標籤更能決定結果。

接下來看四個可驗證訊號

  1. 分母是否公開:不只報告攔到多少異常,也揭露哪些流量沒有日誌、沒有監控或被排除。
  2. 外部審查能否重做:讓獨立團隊在保密條件下接觸 Model 2、工具環境、未刪節指標與失敗樣本,而非只評論摘要。
  3. 「不到 2 倍」如何定義:公布基準期間、模型世代、延遲修正與反事實估計,避免把任務速度、勞動生產力與公司進度混成同一倍數。
  4. 跨線後會做什麼:報告認為自動化研發在 6 至 12 個月內成為重大疑慮是合理可能;下一版應清楚說明接近 2 倍或 85% 預估線時,哪些部署會延後、縮權或接受外部否決。

如果下一份報告只更新分數,價值有限;如果它能把模型能力、實際權限、監控覆蓋與決策後果連成可重做的證據鏈,才算真正把透明度變成問責。

接著閱讀

左右滑動查看更多推薦

現在最實用的下一步,是把任何高權限 AI Agent 當成內部系統而非聊天工具:先列出它能寫入的資源、保留可追溯日誌,並在能力變強前就定義誰能按下停止鍵。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多兩封,收到週報精選與關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。