2026 年 7 月 28 日,Anthropic 的 Frontier Red Team 發布〈Discovering cryptographic weaknesses with Claude〉。這份 Claude 密碼分析報告同時帶來兩個很不一樣的結果:HAWK 後量子簽章候選方案的核心安全估算被實質改寫;另一個針對 7 輪 AES-128 的方法,則仍離攻擊完整 AES 很遠。更關鍵的是,HAWK 團隊在報告公開隔天正式確認問題並宣布退選,讓這件事從一篇公司研究報告,迅速變成真正改變標準化進程的案例。

截至 2026 年 7 月 30 日 13:45(台北時間),這篇報告在 Hacker News 累積 226 分與 180 個討論樹回覆。這證明它引起高度關注,卻不是科學驗證本身。下面依序把原文主張放回技術脈絡、對照論文與官方回應,再判斷這次突破究竟屬於模型、研究系統,還是驗證流程的進步。
Claude 密碼分析跨過的門檻:從程式錯誤到數學結構
“Now, we have found that Claude is able to find mathematical flaws in the algorithms themselves.”
中文:現在,我們發現 Claude 已能找出演算法本身的數學缺陷。
Anthropic
這句話是原文最重要的主張。過去模型找到的密碼漏洞,常是某個函式庫把正確演算法寫錯;這次研究瞄準的是演算法設計所依賴的數學結構。Anthropic 也公開了兩份技術論文與示範程式,讓外界能檢查證明、成本模型與可執行元件。
| 結果 | 真正做到的事 | 證據強度 | 現實影響 |
|---|---|---|---|
| HAWK | 把關鍵恢復問題降到約一半維度的格約化;在弱化的 HAWK-256 挑戰參數端到端恢復等價簽章金鑰 | 程式可執行;HAWK 團隊確認攻擊約使 block size 減半,NIST 官網確認退選狀態 | 候選方案退出標準化;不是已部署系統遭入侵 |
| 7 輪 AES-128 | 改進 2013 年已知的 meet-in-the-middle 攻擊成本 | 數學推導、縮小實驗與真實 AES 元件量測;全規模攻擊未端到端執行 | 沒有觸及採 10 輪的完整 AES-128 |
兩者都被稱為「attack」,但可驗證性差了一個世界。HAWK 有能產生有效簽章的金鑰恢復結果,並且直接改變候選方案命運;AES 則是極端資源模型下的理論改進。把它們包成一句「Claude 破解密碼學」,會同時高估 AES、低估 HAWK。
HAWK:兩輪公開評估後,Claude 輔助攻擊補上關鍵缺口
HAWK 是格基後量子數位簽章方案。Anthropic 發表時,它剛進入 NIST 額外數位簽章計畫第三輪,已經歷兩輪、約三年的公開評估;但尚未成為標準。NIST 2026 年 5 月的評估報告也早已指出,HAWK 較新穎的安全假設與代數結構仍需要更廣泛分析。因此,準確說法不是「人類三年毫無線索」,而是公開審查已看見風險區域,這次人機協作把一條尚未完成的攻擊路線接成了證明與實作。
HAWK 論文把金鑰恢復降為在 n/2 + 1 維度求解 exact-SVP。以論文表格的可比數字來看,HAWK-512 所需的 oracle 維度由 452 降到 257,HAWK-1024 由 940 降到 513;作者的總閘數模型則把兩者的金鑰恢復估算分別從 2150 降至最多 2108、從 2288 降至最多 2182。所以「安全強度砍半」只能當方向性簡稱:被約減半的是關鍵格維度或 block size,不是每一個安全指數都直接除以二。

真正跑通的是 HAWK-256:這是設計者刻意保留、約 64-bit 強度的密碼分析挑戰參數,不是 HAWK-512 或 HAWK-1024 的正式提案等級。論文報告在單台 96 核心 Sapphire Rapids 伺服器上於數小時內完成;官方 demo README 的參考 profile 估計完整流程約 3 小時 42 分鐘。攻擊會恢復一把功能等價的簽章金鑰,再用它產生可驗證簽章;作者也明確寫明沒有嘗試 HAWK-512。這是一個真實的端到端攻擊展示,但不能改寫成「正式參數已在數小時內破解」。
隔天退選,代表標準化機制成功,不是部署事故
提交團隊表示,Anthropic 早在 6 月便已私下通報這項分析;7 月 29 日,也就是報告公開隔天,團隊才在 NIST PQC 論壇正式確認,攻擊大約把格約化所需 block size 減半。這不是只花一天完成全部驗證。他們判斷,單純把參數放大一倍或改用更高 rank 會讓 HAWK 失去競爭力,因此主動退出;NIST 候選頁面也已標記 withdrawal。

這個後果很實質,卻不是資安災難。HAWK 尚未標準化;這個證明針對 HAWK 的結構,論文也另有專節說明為何不能直接轉用 Falcon。它不能被外推成 ML-DSA、Falcon/FN-DSA 或整個格基家族受到同一攻擊。公開候選在大規模部署前被淘汰,本來就是密碼標準競賽最希望得到的結果。
7 輪 AES:方法有新意,離完整 AES 仍極遙遠
另一個結果需要更嚴格的語言。依 NIST FIPS 197,完整 AES-128 使用 10 輪;Anthropic 攻擊的是 7 輪版本。這類 reduced-round 研究的價值,是測量安全餘裕與發展密碼分析工具,不等於現有產品正在使用一個少三輪的 AES。
Nasr 與 Carlini 的論文提出稱為 Möbius Bridge 的代數關係,再用它構造對相關變換不敏感的 fingerprint,省去一個 256 值猜測迴圈;配合多項工程最佳化後,方法改進了 2013 年 Derbez、Fouque 與 Jean 的 7 輪攻擊。在固定需要 2105 筆 chosen plaintext 的前提下,作者估算 online time 約為 291.4,最樂觀的細緻帳本約為 289.28;這就是「約快 200–800 倍」的來源。它比較的是作者模型下的線上工作量,不是完整攻擊的實測牆鐘時間,也沒有減少 2105 的資料需求。
論文實際執行的是縮小版 cipher、已知金鑰驗證框架、部分真實 AES 表格與候選探測,以及各元件的速度量測;完整的 2105 查詢與 288 表格未端到端執行。把量測常數外推到全規模後,論文 Table 10 對「同樣加入最佳化的舊方法」給出的總週期改善約 114 倍,對「2013 年原始發表版本」則約 362 倍。基準不同,倍數就不同,這正說明 AES 結果應讀成方法與成本模型的進展,而不是可立即利用的漏洞。

配套 artifact 還加入一段 Lean 證明,但範圍只涵蓋完整 256-bit χ★ orbit 的計數界。實際使用的 13-byte 截斷 fingerprint 假陽性率,以及 wrong-key 是否近似均勻,仍依靠量測與 heuristic 假設;不能把這段形式化工作寫成整個攻擊已完成機器驗證。
密碼學家 Matthew Green 的獨立評論因此把 HAWK 視為有份量、可檢查的成果,對 AES 則更保留:它是合理的學術改進,但本質上仍是無法在完整尺度執行的 constant-factor 進步。這不是說 AES 工作沒有價值,而是兩個頭條放在一起時,證據重量不應被平均。
Claude 密碼分析背後:研究單位其實是一整套系統
這套 Claude 密碼分析流程不是在聊天視窗問一次問題。Anthropic 表示,團隊讓 Mythos Preview 在多代理鷹架中讀文獻、呼叫 Python 與 Sage、提出假說並跑實驗;HAWK 工作約 60 小時、API 成本約 10 萬美元。AES 專案則據稱累積約 10 億個輸出 token、同樣約 10 萬美元,之後兩位研究者又花數百小時、接近一個月建立信心。這些時間、token、成本與自主程度均採 Anthropic 的公司披露值。
人類仍然選題、設計鷹架、管理方向、判斷何時值得深挖、檢查證明並整理論文。Anthropic 也說明,公開的 AES 推理文件是 Claude 對一段成功工作歷程的重寫整理;其他許多嘗試沒有結果。它提供可追蹤線索,但不是所有成功與失敗過程的原始完整紀錄。
格密碼學家 Chris Peikert 對 HAWK 的第一反應是肯定攻擊的數學份量;他隨後又補充,成果關鍵地建立在近期人類對 LIP 的工作上。較公平的理解是:Claude 沒有從真空創造一套全新數學,而是找出缺失的連接、組合既有工具,並把它推成可驗證的端到端攻擊。對研究而言,這已經很重要。
AlphaLab 的判讀:HAWK 改變標準,AES 改進方法
一、同一個「攻擊」字眼,可能代表完全不同的證據
HAWK 的結果能在弱化參數上恢復簽章能力,正式參數所需 block size 約減半也得到提交團隊確認;AES 的結果則依靠未端到端執行的複雜度帳本、縮小實驗與真實 AES 元件量測。未來讀 AI 研究新聞,最先要問的不是 benchmark 數字多大,而是:最後的物件能不能產生、驗證或失敗?如果不能,哪些環節是量測,哪些只是外推?
二、真正可複製的能力,是模型、工具、算力與驗證者的乘積
把成果全歸功於「Claude 很聰明」會漏掉決定性條件:可搜尋文獻、可執行數學軟體、能平行探索的代理架構、六位數美元推理成本、投入核驗的人類研究者,以及外部密碼學家與提交團隊。模型讓搜尋空間變大;研究系統讓搜尋不至於散掉;人類與社群讓一個候選答案升格為知識。
三、HAWK 退選是防禦成功,不是密碼世界失守
後量子標準的目的,不是保證候選永不被攻破,而是在大規模採用前邀請最強對手來拆。AI 把攻擊假說的產生速度放大後,標準機構更應把它納入紅隊流程;但裁判仍要由獨立重現、公開反駁與明確證據規格共同擔任。
四、生成研究變快後,真正稀缺的是驗證頻寬
HAWK 約 60 小時的模型協作,很快引來專家核對與提交團隊回應;AES 則需要數百小時人力,仍無法用完整實驗直接對帳。若未來模型每天都能產生大量新攻擊,研究社群需要的將不只是更多答案,而是統一的成本帳本、可執行 artifact、失敗紀錄、獨立重跑與更精準的形式化驗證範圍。
我同意什麼,又存疑什麼?
我同意 Anthropic 的 HAWK 成果已跨過「有趣 demo」門檻:它補上重要數學缺口、產生可執行攻擊,並促使候選方案退出。對 AES,我同意新代數關係與工程組合值得密碼學社群檢查;我存疑的是把兩者一起包裝成「頂尖專家級密碼研究能力」。這兩項個案的研究設計不是 Claude 與人類專家的受控比較,成果也依賴專用鷹架、昂貴算力與大量人工驗證。最可靠的結論,是 Claude 已成為能影響研究決策的強力合作者,而不是它已單獨取代頂尖密碼學家。
以後看到「AI 破解密碼」,先問這五件事
- 攻擊的是什麼?是已部署標準、仍在評選的候選,還是 reduced-round/challenge 版本?
- 用的是正式參數嗎?弱化參數跑通,和正式安全等級的成本被估低,是兩種不同證據。
- 資源模型完整嗎?時間之外,還要一起看 chosen plaintext、記憶體、oracle 與成功率。
- 真的端到端跑過嗎?元件測速與全規模外推,不能寫成完整攻擊實測。
- 誰獨立回應了?原作者確認、標準機構處置、外部重現與正式同行評審,各自代表不同強度。
延伸閱讀
想理解這次研究為何不是「多問模型幾次」,可先讀 AI Agent Harness 是什麼? 與 如何動手搭最小 Agent Harness;若你關心 AI 加速研究後,驗證為何會成為瓶頸,延伸看 當 AI 開始打造 AI。要比較研究型代理與日常 coding assistant 的差別,可再讀 Claude Code vs Codex,以及 AI Agent 的密鑰與權限安全,把「模型能提出什麼」和「系統如何安全驗證」放在同一張圖裡。
