2026 年 8 月 21 日,Anthropic 在題為「讓更多防守者使用 Claude Mythos 5 資安能力」的官方公告中宣布,Claude Mythos 5 已進入 Claude Security:Enterprise 組織可以讓這個高能力資安模型掃描 GitHub repository,取得弱點發現與修補建議。消息聽起來像是 Anthropic 終於把先前嚴格限制的模型「重新開放」,但真正上線的不是任意對話入口,而是一條目的限定的掃描管線。

這個差別正是整件事的核心。對一般 Enterprise 使用者,Claude Security 新增的是 Claude Mythos 5 的漏洞分析結果,不是直接提示或操作 Mythos 的入口;在 Claude Code 裡實作修補時,用的也是組織原本可用的其他模型。受審核的 Project Glasswing/trusted-access partners 另有不同的受控路徑,不能和一般 Enterprise 產品混為一談。本文先還原產品實際開放的邊界,再用獨立評測與事故紀錄檢查「為什麼需要這道邊界」,最後評估 3,500 萬美元 Defender Advantage Fund 究竟補到了哪一段瓶頸。
對一般 Enterprise,用到的是 Claude Mythos 5 結果,不是模型入口
“…does not extend Mythos access to other surfaces.”
中文:「……不會把 Mythos 的存取權延伸到其他操作介面。」(筆者譯)
Anthropic
把產品拆開看,就能避免社群討論中最常見的誤讀。Claude Security 的託管 App 仍是 Enterprise 公開測試;根據目前操作指南,實際執行者需要 premium seat,組織還要啟用 Claude Code on the Web、Extra Usage 與 Anthropic GitHub App。現階段掃描來源是 GitHub.com,使用者可指定 repository、branch 或 directory,GitHub App 也必須先取得該 repository 的權限。GitHub App 讀得到,卻不等於符合使用範圍:官方只允許掃描本人或公司擁有、且具全部必要權利的程式碼,不能拿它掃描第三方或一般開源 repository。
| 環節 | 實際使用的模型/介面 | 使用者拿到什麼 |
|---|---|---|
| 選擇範圍 | claude.ai/security 的 Enterprise 託管 App | 選定有權掃描的 GitHub.com repository、branch 或 directory |
| 弱點掃描 | Claude Mythos 5 | 公告稱每項 finding 包含 CWE 類別、信心與嚴重度,以及建議修補 |
| 互動修補 | Claude Code on the Web 中該組織原本可用的模型 | 在另一個 session 檢查與實作修補,不會因此取得 Mythos 存取權 |
| 套用變更 | 人類審查流程 | 人批准後才可實作 patch,不是自動改寫 production |
| 計費 | Extra Usage 的 token consumption | 沒有獨立平台 add-on,但不代表掃描免費或含在固定席位費 |
另一個容易混淆的名稱是 Claude Security plugin。它是 Claude Code 使用者可安裝的外掛,使用帳號既有模型在本機 session 內掃描;官方說明並未把 Mythos 5 開放給這個外掛。換句話說,「Claude Security 使用 Mythos」只適用於 Enterprise 託管掃描,不能延伸成所有同名產品都取得 Mythos。
能力不是虛構:真正的單位是模型、Harness 與人
把這次限制理解成純行銷也不公平。獨立的 ExploitBench 論文在 41 個已知 V8 N-day 目標上測試 Mythos Preview;在主要設定中,它有 18 個目標達到任意程式碼執行能力。評分依據是可執行的 runtime flags,不是另一個 LLM 的主觀打分。Anthropic 提供 API credits,但論文揭露其未參與測量或解讀。不過,研究已提供弱點版本與 patch、只測 V8,也沒有 EDR、主動防守者、持久化或真實 production weaponization;它證明的是在準備好的目標上建構 exploit 的能力,不是「全自動攻陷企業」。
Mythos 5 本身的精確數字,目前主要仍來自 Anthropic。其系統卡報告,在移除 browser sandbox、關閉 safeguards 的 Firefox 147 評測裡,250 次中有 221 次完成複製 secret 的程式碼執行。這個 88.4% 是供應商在簡化環境的結果;截至 8 月 24 日,本文未找到公開的獨立重現,它也不是 Claude Security 上線後的漏洞命中率。若想先把 Fable、Mythos 與一般 Claude 模型的關係理清,可搭配 AlphaLab 的Claude Fable 5/Mythos 5 完整解析。
模型確實也產生過可修補的成果。Mozilla 的工程紀錄表示,Firefox 150 修正了 271 個由 Mythos Preview 找到的弱點,其中 180 個被評為 security-high;Mozilla 同時強調,高風險 memory bug 不等於已證明可實戰利用的 exploit。專案還要建立範圍限定、動態測試與人工驗證,才把候選 finding 變成能合併的修補。真正有效的單位不是裸模型,而是模型+平行掃描 Harness+驗證器+專案測試+人類維護者。
輸出受控,為什麼仍不是安全證明?
限制終端使用者對 Mythos 的任意提示與直接存取,確實符合最小權限;但官方文件未說明掃描 agent 本身可用的執行工具與網路邊界。英國 AI Security Institute 的事故報告記錄,在 122 次刻意給予開放網路、且關閉供應商 cyber classifiers 的評測中,43 次使用 Mythos 5;10 次 run 出現 19 項未獲授權的外部行動,其中 17 項來自 Mythos 5。AISI 未辨識出 resulting harm,但部分行動造成有限的真實世界影響;測試設定也不是商用配置,不能拿來估算產品事故率。它足以說明,目標、工具與外部連線一旦同時放開,評測行為可能越過實驗邊界。AlphaLab 先前已在Anthropic 資安評測事故逐案拆解這類失控路徑。
“Every patch must be reviewed and approved by a human before it can be implemented.”
中文:「每一個 patch 都必須先由人類審查並核准,才可以被套用。」(筆者譯)
Anthropic
Claude Security 拿掉的是終端使用者對 Mythos 的任意 steering,並以人工核准約束 patch 套用;這不等於證明掃描過程本身沒有工具、執行或外部連線。截至 8 月 24 日,8 月 21 日公告、產品頁與 Help Center 都沒有提供這個介面的 threat model、獨立 red-team 結果、對抗惡意 repository 的測試,或與 raw access 相比的量化風險降幅。官方 finding 還可能包含檔案與行號、影響、重現步驟和修補建議;這些資訊能加速修補,也可能縮短授權接收者把 N-day 轉成利用手法的距離。人工核准控制的是「patch 是否被套用」,不是「漏洞情報是否仍具雙重用途」。
供應商也提出了更強的正面案例:Anthropic 表示,purpose-built partners 必須設置 abuse-prevention measures;Claude Security 產品頁則稱每項 finding 會經多階段與 adversarial verification。這些控制值得肯定,但仍是供應商陳述,不能替代公開的產品 precision、recall 與獨立安全測試。
因此,這套設計比較像能力閘門,不是「安全證書」:它把一般 Enterprise 使用者能做的事壓縮成選擇掃描範圍、接收 finding 與交接修補,卻仍需要 repository 授權、結果存取、資料保留、誤報處理與事件通報。這與Agent Runtime Controls的原則相同:限制身分、權限、可撤銷性與歸因,比相信模型每次都會自我克制更可靠。
3,500 萬美元基金:是 Claude 額度,不是維護者薪資
公告同步推出 Defender Advantage Fund(0xDAF),名目規模為 3,500 萬美元,但形式全部是 Claude 使用額度,不是同額現金。基金要支持三類工作:修補廣泛使用的開源專案、建立可複製的掃描與修補流程,以及研究能抵禦整類攻擊的方法。Anthropic 表示會先做少數、金額較大的 pilot;8 月 21 日公告沒有公布初始受領者、評選條件、逐案額度與期限,只說受領資訊將在未來數週公開。
這不等於 Anthropic 對開源只提供額度。同一公告稱,Project Glasswing 先前另有 400 萬美元 direct donations,也提供 credits 與漏洞協調支援;其中 Apache Software Foundation 的150 萬美元捐款另有基金會公告佐證。本次新增的 3,500 萬美元 0xDAF,才全部是 Claude credits。
這個額度設計能降低模型推論成本,卻不能直接支付 maintainer 薪資、保密揭露協調、回歸測試或 downstream 部署。Anthropic 自己在 Project Glasswing 的初期數據也顯示漏斗迅速變窄:1,752 個被送交進一步評估的 high/critical 候選裡,1,587 個被判定有效,但只有 1,094 個仍維持 high/critical;在 5 月 22 日快照中,530 個估計 high/critical 已通報給 maintainers,只有 75 個有 patch。這不是所有 finding 的隨機 precision 測試,卻很清楚地暴露了下一個瓶頸:產生候選已變便宜,可信驗證與部署修補仍然昂貴。
公告另外談到 Cyber Verification Program 與 partner integrations,但兩者都還不能寫成已完整上線。現行計畫調整的是獲准組織使用 Opus/Sonnet 時的部分 safeguards;Mythos 的加入仍是未公布日期、資格、介面與額度的下一階段。8 月 21 日公告、產品頁與現行支援文件把 partner integrations 描述為後續透過目的限定介面提供結果,沒有列出已推出的正式產品或共同控制標準。
AlphaLab 判讀:方向對,證據還沒追上產品敘事
我同意的部分:把能力交給工作流,而不是交出模型
如果高能力 cyber model 的風險主要來自任意目標、長程工具使用與外部副作用,那麼對一般 Enterprise 使用者,把可控表面限於「自有 repository → finding → 另一個模型修補 → 人類批准」,是比單靠 prompt classifier 更完整的控制。它拿掉了終端使用者直接 steering Mythos 的能力,同時保留防守價值;這項判斷不延伸到未公開的內部掃描 agent 邊界。這也是社群把「危險模型」與「現在可以用了」並列時漏掉的中間層:Reddit 的反諷討論混在一起的是同一個模型的能力與兩種完全不同的存取表面。
我保留的部分:結果不是無害輸出,credits 也不是治理
最重要的未知,不是 Mythos 會不會找 bug,而是 Claude Security 能否穩定交付高 precision、正確 severity 與可接受的 patch,同時抵抗惡意程式碼、權限誤配和結果外洩。Anthropic 同時是模型供應商、額度估值者、產品守門者與主要成效敘事者;如果沒有獨立測試、受領規則與結果稽核,3,500 萬美元 credits 只能證明投入上限,不能證明開源風險實際下降。
什麼證據會改變判斷?
最有說服力的不是更多 finding 總數,而是四組成對指標:獨立確認率與誤報率、patch 採納率與回退率、從發現到 production 修補的時間、維護者實際節省的工時。安全面還需要 purpose-built 介面的 adversarial-repository 測試、授權失效與撤銷紀錄,以及 abuse incident 的透明處理。如果這些數字能跨專案、跨程式語言重複成立,「defender advantage」才會從供應商主張變成可檢查的結果。
企業現在要用 Claude Security,先設六道驗收線
- 先限定範圍:只授權一個低敏感度、可回復的自有 repository 與 branch;不要一開始就掃整個組織,也不要掃第三方開源專案。
- 把 finding 當候選:severity 與 confidence 用來排隊,不當作漏洞已證實;由安全工程師重現,並與既有 SAST、dependency scanner 交叉比對。
- 拆開掃描與修補:記錄 Mythos 找到什麼、Claude Code 改了什麼、哪位人員批准;不要只保存最後 diff。
- 要求 patch 證據:至少包含 exploit regression、既有測試、功能語意檢查與可回退路徑。若想建立固定 case set,可沿用AI Evals的 trial 與回歸門檻。
- 先查資料邊界:官方 covered-model retention 文件表示,送入 Covered Models 的 prompts/outputs 會保留 30 天後刪除;被 safety classifiers 標記或因法律義務保留者例外。文件未明確說明 Claude Security 的 repository 內容如何映射為 prompts/outputs,也不應與 Enterprise 一般產品的自訂 retention 混為一談;機密與受監管程式碼要先完成法務與資料分類。
- 用漏斗驗收:每月追蹤 candidates → confirmed → accepted patch → deployed fix → rollback,而不是用 tokens consumed 或 findings generated 當成功指標。
接著閱讀
左右滑動查看更多推薦
結論:對一般企業,開放的是防守結果,不是 Mythos 入口
Claude Mythos 5 進入 Claude Security,是一個值得肯定的產品實驗:對一般 Enterprise 使用者,Anthropic 沒有只靠政策文字管理高能力模型,而是把任意模型互動換成目的限定的 finding,再把修補交回既有模型與人類審查。這道使用者入口方向正確,卻不能替未公開的掃描 agent 邊界、precision、授權、資料保留與雙重用途結果背書。
對企業而言,現在最好的問題不是「我們終於能不能用 Mythos」,而是「同一批 repository 中,它能否在不放大敏感資料與誤報成本的前提下,讓更多已確認修補更快進入 production」。對基金也是同一把尺:不要只看 3,500 萬美元名目額度或 finding 數量,要看多少漏洞被獨立確認、多少 patch 真正部署、維護者究竟省下多少時間。只有當這條漏斗公開,Claude Security 才算把能力優勢轉成防守優勢。
