跳到主要內容

GLM-5.3 資安能力:Anthropic 50/410 次漏洞利用,開放權重風險怎麼看?(2026)

最後更新: ·
開放權重能寫攻擊?GLM-5.3 資安能力測試

2026 年 9 月 29 日,Anthropic Frontier Red Team 在官網發布〈GLM-5.3 and the spread of advanced cyber capabilities〉,把 GLM-5.3 資安能力放進一組漏洞利用與安全防護測試。文章最刺眼的結果是:在隔離環境的 ExploitBench,GLM-5.3 於 410 次嘗試中完成 50 次端到端漏洞利用;受限提供的 Claude Mythos Preview 則是 56 次。這是模型能力的警訊,也是讀懂「可下載權重」與「可實際濫用」之間距離的好案例。

Anthropic 2026 年 9 月 29 日 GLM-5.3 資安能力原文頁面截圖
點圖閱讀 Anthropic 原文;畫面/Anthropic,瀏覽器框架/AlphaLab。

下文先還原 Anthropic 的證據,再對照美國 NIST 的獨立評估,最後拆開三個容易混淆的問題:模型能不能做、一般人拿不拿得到、實際攻擊是否已發生。

Anthropic 說了什麼:能力與取得門檻同時變了

GLM-5.3 不是 9 月 29 日才推出的模型。Z.ai 在 8 月 14 日發表模型,8 月下旬才把權重交付下載;Anthropic 這篇的新事實,是對它的資安能力和防護機制所做的測試。Anthropic 的中心論點是:能處理較完整漏洞利用流程的能力,已出現在可下載、可改動的模型權重上。這使「模型供應者能否在 API 端擋下要求」和「能力是否可被第三方帶走」成了兩個不同問題。

50/410 對 56/410:接近的是哪一項能力?

We find that GLM-5.3 develops end-to-end exploits in 50 of 410 attempts.

中文:在 410 次嘗試中,GLM-5.3 有 50 次完成端到端漏洞利用。

Anthropic Frontier Red Team,2026 年 9 月 29 日

Anthropic 使用的 ExploitBench 原始論文設有 41 個已知 V8 漏洞,評量從觸發程式錯誤到取得執行能力的不同階段。Anthropic 在隔離、無網路的測試建置中,每個模型共跑 410 次嘗試;50/410 約為 12.2%,56/410 約為 13.7%。兩者在這個特定的「完整利用」指標相近,但這些數字沒有證明兩個模型的整體資安能力相等,也沒有測量真實網路入侵的成功率。

Anthropic 圖一:GLM-5.3 與 Claude Mythos Preview 的 ExploitBench 結果與模擬防護測試
原圖上半比較隔離 ExploitBench 的完整利用比例,下半比較模擬有害指令下的反應;圖/Anthropic。

Anthropic 另在自家 Binary Exploitation 測試的隨機 100 題子集中,報告 GLM-5.3 的完整控制流程劫持率為 4%、Mythos Preview 為 6%。這是 Anthropic 的內部測試,題目與執行記錄並未在本文找到足以獨立重算的完整公開材料;因此 4% 與 6% 應當視為該實驗的自述結果,而不是公認的模型排行。

Anthropic 圖二:不同輸出 token 預算下的 ExploitBench 與內部測試曲線
曲線顯示成功率與輸出 token 預算一起變動;圖/Anthropic。

NIST 有沒有看到同一個方向?有,但兩份數字不能相除

NIST 旗下 CAISI 在 9 月 17 日的評估,將 GLM-5.3 描述為其已評估的開放權重模型中資安能力最強者;在綜合四種資安基準的能力指數上,CAISI 估計它約落後當時美國前沿模型四個月。這提供了與 Anthropic 不同機構的方向性佐證,也同時限制了更誇張的解讀:NIST 的整體指數仍把 GLM-5.3 放在前沿之後。

尤其別把 NIST 的 ExploitBench「61.1%」拿來對照 Anthropic 的「12.2%」:NIST 記的是 41 題、每題三次嘗試後的最佳 16 階段得分平均,Anthropic 說的是 410 次嘗試中真正完成端到端利用的比例。分母、計分方式與模型設定都不同。NIST 也說明,美國模型在適用時關閉了資安防護,且比較組包含僅對受信任者開放的版本;能力比較不能直接等同一般使用者的可取得能力。

64%、92%、100%:這些是模擬環境的「願意繼續」,不是攻擊命中率

Anthropic 的另一組測試讓模型面對明顯有害的資安要求,記錄它是否嘗試連向遠端目標。在每格 50 次的模擬中,原版 GLM-5.3 對直接要求為 0%;換成假稱演練情境後是 64%,預填推理脈絡後是 92%;Anthropic 修改權重、降低拒答傾向的版本是 100%。這些百分比描述的是該實驗條件下的模型行為。

原文還做了一次權重修改實驗:Anthropic 報告,GLM-5.3 在三個有害請求基準的平均拒答率,由約 95% 降至約 6%;它的 GPQA-Diamond 成績在該測試中持平,CyberGym 子集略低。這支持「拒答層可被削弱」的擔憂,但修改成本、可重現性與其他任務損失仍需由獨立測試確認。

Anthropic 圖四:GLM-5.3 修改權重前後的拒答率與能力測試
原文報告修改後平均拒答率下降,部分能力測試近似持平;圖/Anthropic。
Anthropic 圖五:模擬有害資安要求下 GLM-5.3 與 Claude 的反應矩陣
每格 50 次模擬;紅色百分比是模型嘗試連向假目標的比例,不是實際入侵成功率;圖/Anthropic。

These simulations are not perfect portrayals of real-world conditions

中文:這些模擬無法完整代表真實世界的條件。

Anthropic 原文註腳,2026 年 9 月 29 日

這句註腳是閱讀圖表的關鍵:Anthropic 說,模擬中的 bash 工具不執行模型寫出的程式,結果由另一個模型近似生成。該測試可以觀察拒答與行動傾向,卻不能單獨證明一次真實攻擊會成功。Anthropic 報告受防護 Claude 模型在同一批可適用條件下未接續有害要求;但「預填推理」與「修改權重」不適用於它提供的封閉 API,不能把空白格算成一場全面、同條件的勝利。

原文還有兩個更強的主張,公開證據暫時到哪裡?

Anthropic 表示,研究者在離線 Linux 瀏覽器建置中,讓 GLM-5.3 找出未知漏洞並組成讀取檔案的利用鏈,已向維護者通報。它也描述 GLM-5.3-Flash 在研究者給出公開漏洞資訊後,花約八小時模型工作、二十分鐘人類注意力完成另一條已知漏洞利用鏈。這兩項案例說明原文作者為何擔憂;公開文章呈現的是經刪節的畫面與敘述,維護者確認、修補細節和可供外部重算的逐步紀錄尚非本文可驗證的材料。因此本文只把它們當作 Anthropic 報告的案例,不推成「真實使用者已受害」。

我的判讀:問題不只是哪個模型跑分高

GLM-5.3 資安能力真正改變討論的地方,是把一組值得警覺的利用能力,和可下載權重的取得方式放在同一張圖上。

能力、可取得性與防護是三個相乘的條件

如果模型能把漏洞描述變成利用程式,但只在受信任的封閉測試環境中提供,濫用者仍有取得門檻;如果同一級能力能下載權重,API 的拒答政策便不再是唯一控制點。這是 Anthropic 最有力的論點。NIST 的獨立能力評估支持「開放權重模型資安能力正在提高」這個方向;Anthropic 的模擬則提供可修改權重後防護更脆弱的案例。兩者合在一起是合理的預警,但尚不是對未來攻擊頻率的量化預測。

競爭者的結論需要拆成證據與政策主張

Anthropic 一面發布競爭模型的測試,一面主張擴大受控前沿模型對防守者的取得管道,也呼籲政府對強模型做獨立安全測試。這些建議有其防禦邏輯,亦符合 Anthropic 自身的產品與治理路線;利益關係提醒我們檢查實驗設計,不構成推翻數據的證據。反過來說,開放權重也能讓授權防守者在本地檢驗、修補與審核。真正要比較的,是漏洞修補速度、模型濫用成本與驗證透明度,而非只看「開放」或「封閉」標籤。

最可驗證的後續不是另一張跑分圖

接下來應追蹤三類公開證據:相關漏洞是否獲維護者確認與修補、獨立團隊能否在相同設定下重複完整利用結果、以及防守者使用模型後的修補時間是否縮短。只要測試仍混用不同題組、token 預算與安全設定,單一百分比就不值得當作模型安全排名。

讀者現在可以做什麼?

如果你維護軟體,先盤點暴露於外部的服務與修補延遲,建立授權測試、隔離執行和負責任揭露流程;若要讓 AI 協助找漏洞,保留人工複核及可追溯的測試紀錄。若你只是讀到「模型可以自動駭入」的標題,先問三件事:它是在已知漏洞還是未知漏洞上測試?結果是完整利用、嘗試連線,還是分階段得分?比較對象能否被一般人以同樣方式取得?

接著閱讀

左右滑動查看更多推薦

下一次看到新模型的「攻擊成功率」,先查清楚測試終點與執行環境,再決定它要求你加快哪一項防禦工作。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。