跳到主要內容

Claude 黎曼 ζ 函數研究:67.25% 的真正突破,不是解出黎曼假設(2026)

最後更新: ·
Claude 黎曼 ζ 函數研究封面,67.25% 無條件下界與圓規主視覺。

Claude 黎曼 ζ 函數研究出現了一個值得認真看、但更值得把話說準的結果。2026 年 8 月 10 日,Anthropic 公布一份由未發布研究版 Claude 署名的技術手稿:它主張在不假設黎曼假設、也不假設零點都靠近臨界線的前提下,把「單零點且位於臨界線」的漸近下界推至約 67.25%。這可能是 AI 參與原創數學的重要案例;它仍然不是解出黎曼假設。

這次讓人興奮的,不是 Claude 又多拿了一個 benchmark 高分,而是它留下了可閱讀的 35 頁論文公開的 Lean 4 證明 artifact,以及一條能讓數學家逐步反駁或確認的推導鏈。不過,截至台北時間 8 月 13 日,公開可核實的仍是 Anthropic 自行託管的研究稿、程式碼與早期審查紀錄;它還需要更廣泛、獨立的數學檢驗。

先把原始研究說明放在這裡。點擊下圖會在新分頁打開 Anthropic 原文。

Anthropic 的 Claude 黎曼 ζ 函數研究說明頁面,畫面包含文章標題與數學圓規主視覺。
Anthropic 於 2026 年 8 月 10 日發布研究說明;點圖可閱讀原文。圖/Anthropic(網站截圖)

67.25% 到底在數什麼?

黎曼 ζ 函數的「非平凡零點」都落在一條稱為臨界帶的區域。黎曼假設要求的是:每一個非平凡零點的實部都等於 1/2,也就是全都在臨界線上。它是全稱命題,不是一條可以顯示完成進度的百分比。

Claude 手稿的 Theorem D 說的是漸近下密度:對任意很小的誤差 ε > 0,當觀察高度夠高時,至少 67.2500% − ε 的非平凡零點是單零點,而且位於臨界線上。單零點可以白話理解成「只出現一次、不重複堆疊的零點」。分母仍按重數計算所有零點,因此這不是把已算出的前 100 顆零點逐顆勾選 67 顆,而是一個關於無限遠處整體比例的保底定理。

這個差別很重要:即使某一天有人證明「幾乎 100%」的零點在臨界線上,只要還容許少數、甚至無限多但密度為零的例外,也依然沒有證明黎曼假設。Anthropic 自己說得很直接:

“We don’t expect that the techniques Claude used will lead to proving the Riemann hypothesis.”

中文:「我們不認為 Claude 使用的這套技術,會通往黎曼假設的證明。」

— Anthropic, Learning more about Claude’s mathematical capabilities

所以最準確的短句不是「Claude 解了 67.25% 的黎曼假設」,而是:Claude 手稿主張把一個關於臨界線零點的無條件漸近下界推到 67.25%。


41.6%、41.73%、40.75%:三個數字不能混著用

Anthropic 的新聞式說法是把已知下界從 41.6% 推進到 67.2%。方向沒有錯,但若要精確比較,必須先對齊「到底在數哪一種零點」。2020 年的 Pratt、Robles、Zaharescu、Zeindler(PRZZ)論文不只給出「超過 5/12」這個乾淨界線,還報告了更高的數值優化。

數字它回答的問題應怎麼讀
41.7293%至少多少零點位於臨界線PRZZ 的較精確舊結果;分子、分母都按重數計
40.7511%至少多少零點既是單零點、又位於臨界線與新手稿「單且在線」最直接的舊口徑
67.2500%至少多少相異零點在線;也證明同等比例的零點單且在線Claude 手稿主張的無條件漸近下界,精確值是三角函數常數
Anthropic 的 41.6% 是把 5/12 = 41.666…% 截短後的傳播用說法;67.2% 則是對約 67.2500% 的保守表述。

如果只想記一組公平的前後對照:所有臨界線零點的舊界約是 41.73%;更嚴格、且與新結果直接對齊的「單且在線」舊界約是 40.75%。官方的「41.6% → 67.2%」適合快速傳播,卻不是完整的數學口徑。


真正的新意:不是第一次看見 67.25%,而是拿掉條件

67.25 這個常數並非憑空出現。Montgomery 與 Taylor 早年在先假設黎曼假設成立的條件下得到相近常數;近期人類研究又把條件放寬成「窄盒」:大致先假設相關零點都落在臨界線附近一個會隨高度縮窄的盒子裡,再推出約三分之二的結論。2025 年的 BGSTB 論文就是這條技術路線的重要前置成果。

Claude 手稿聲稱補上的橋樑,是不再要求這個未證明的窄盒前提。它把 Weil 公式形成的 Hermitian form 切成「在線零點」與成對的「離線零點」區塊,再用 Sylvester inertia 與 rank–trace inequality 控制整體,而不是要求每一塊都具備正性。白話說:過去要先假定搗蛋的零點都離中線很近;新論證改成直接衡量整個系統裡,負方向究竟能佔多大空間。

Anthropic 非正式證明筆記中的 67.25% 定理與線性代數推導公式。
Anthropic 公開的非正式 proof note 直接以 67.25…% 定理開場。這是漸近下界,不是逐顆驗證 67% 的零點。圖/Anthropic

如果這一步經得起外部審查,突破點會非常清楚:不是 Claude 首次發現 67.25%,而是它提出一條把同等級界線變成無條件結果的新路。這裡的「無條件」是指不假設黎曼假設或窄盒猜想;它當然仍建立在大量已證明的解析數論工具上。


Claude 怎麼找到它:兩次 session 與 60-agent 搜尋

Anthropic 公開的研究流程附錄顯示,這不是模型看一眼題目就靈光乍現。依官方紀錄,兩個 Claude Code session 合計產生約 3,100 萬個 output token;第一次約 650 個構想都失敗,第二次則由協調器啟動 60 個 subagent,其中 58 個實際執行。主文所稱「約一天半」對應從重新啟動到完成草稿的約 38 小時關鍵路徑;完整第二次 campaign 則歷時約 54 小時、橫跨三個日曆日。Anthropic 另稱全程執行 2,400 次 shell 指令並寫出數百個 Python script。

「54 篇 arXiv 論文」尤其需要更正。Anthropic 主文把它寫成新穎性查核量,但同一份流程附錄的 Appendix A.8 明說:這 54 篇來自沒有流回 two-thirds 核心證明的失敗或旁支,對關鍵結果沒有讀取路徑。真正負責文獻查核的 agent 讀取的是一組較小的核心文獻;附錄另估計整個 campaign 曾抓取約 100 篇 arXiv 論文與 90 個其他學術頁面。因此,不能把 54 當成核心證明直接閱讀、再逐篇排除新穎性衝突的數字。這個矛盾不會直接推翻數學結果,卻提醒我們要把研究證據與行銷式流程摘要分開看。

這些過程數字都是 Anthropic 自述;公開 transcript 也省略了 token counter,只選錄兩個關鍵 subagent 的主要過程,不能獨立重算 3,100 萬 token。它仍揭示了一個比「聊天機器人想出漂亮點子」更有意思的工作模式:大量提出猜想、快速殺掉錯路、做數值壓力測試,再把倖存的論證交給不同 agent 與人類攻擊。

功勞也不能縮成「Claude 單獨完成」。Sumner 設定方向、要求模型繼續並把目標推到三分之二;Anthropic 數學家 Ralph Furman、Levent Alpöge 詳細研究、驗證並放入文獻脈絡;Eric Easley 組織 Lean 形式化。較準確的說法是:這是模型主導核心數學搜尋,人類啟動、導向、審查並承擔責任的人機研究流程。如果你想比較其他「AI 產生新數學」案例,可以接著看 OpenAI Astra 的十項數學成果與 Lean 證書,以及 Fable 提出 Jacobian Conjecture 反例後,數學家如何拆解可驗證性


Lean 驗證了什麼,又沒有驗證什麼?

這次的 Claude 黎曼 ζ 函數 Lean 4 repository不只是把「如果幾個大定理都成立,那麼結論成立」包成一層外殼。最上層的 ζ 函數定理沒有額外數學猜想;原先抽象封裝的顯式公式、Riemann–von Mangoldt、Chebyshev–Mertens 與其他解析工具,也在最終模組裡逐一接回具體證明。Lean 檢查的是精確閉形式常數,換算約為 67.250070%;「67.2%」並不是形式化檔案裡的十進位定理。

倉庫的 AUDIT.md固定了 Lean 4 與 Mathlib 版本,列出重跑指令,並記錄 build、axiom audit、statement comparator 與獨立 nanoda kernel replay 通過;解答模組未見專案自訂公理或證明洞,列出的只有 Lean 標準基礎公理。這是很強的可稽核證據,但通過紀錄仍由 Anthropic 自己發布。本次查核環境沒有安裝 lakeelan,因此只檢查了公開原始碼與固定版本,沒有把官方重跑結果冒充成 AlphaLab 或外部機構的獨立認證。

更根本地說,Lean 能回答「這份形式化定義下,推導是否被 kernel 接受」,卻不會替人判定研究是否新穎、自然語言論文是否與 trusted definitions 完全對齊,也不能證明發現過程的作者歸屬。形式化提高了犯錯的成本與可追查性,但沒有取消人類審查。這和 Claude 參與密碼分析時,成果必須接受領域專家與既有攻擊界線檢驗是同一個道理。

公開審查也已開始留下修正痕跡:GitHub 的 issue #7 指出論文 Lemma 3.2 的 equality case 正規化敘述有誤;提報者同時判斷不等式本身、後續應用與主定理不受影響。截至 8 月 13 日該 issue 仍開啟。這不像足以推翻頭條結論的 proof gap,卻正好說明公開 artifact 與持續人類審讀為何不可省略。


為什麼全網沸騰,卻還不能宣布定案?

截至台北時間 2026 年 8 月 13 日,r/math 討論約有 1,682 票Hacker News 討論276 points、177 則留言。票數仍會變動,也只代表注意力,不代表數學驗證。

現階段的審查證據介於「公司自己說了算」與「數學界已接受」之間。Anthropic 表示兩位內部數學家 Furman、Alpöge 已詳細研究並驗證論文;Brian Conrey 與 Daniel Goldston 則是在短時間內閱讀、檢視並提供意見。後兩位的措辭不等於正式背書,更不等於完整期刊審稿。Furman 也在 HN 回應中表明團隊願意承擔數學責任,同時說仍會繼續打磨論文、準備正式投稿。

因此,現在最合理的態度不是先替它封神,也不是因為作者欄寫著 CLAUDE 就先否定。這份研究已經強到值得頂尖數論專家投入時間;它也新到不足以代表社群共識。研究稿、Lean artifact、內部深度檢查、外部短期閱讀與期刊匿名同行評審,是五種不同層次的證據;目前最後一層尚未完成。


AlphaLab 判讀:這比 benchmark 重要,但還不是「AI 數學家」的畢業證書

1. 新穎性:重點是無條件化,不是 67.25 這個數字

近期人類文獻已把問題推到門口,也提供幾乎所有解析材料;Claude 主張找到的是最後那座線性代數橋樑。若它成立,仍是實質推進,但不是「從零發明兩個三分之一」。

2. 可驗證性:目前 AI 研究案例中少見地強

論文、proof note、部分 transcript、程式碼與形式定理都已公開。外界不必相信一句產品文案,而能直接攻擊定義、引理與常數。這種「可被否證」的形狀,才是成果比 benchmark 更值得重視的原因。

3. 自主程度:模型主導,不等於沒有人類

Claude 做了大規模搜尋、反駁與論證生成;人類負責目標、運算資源、審查、文獻脈絡與形式化協作。這已超過一般「AI 輔助」,卻仍不是一個模型關在房間裡獨自完成研究。

4. 外推能力:一次成功,還不能推出穩定能力

這是資源密集的長時程搜尋,由未公開模型完成,而且我們看到的是被選中的成功案例。由於模型身分、input token 與 cache 用量未公開,現有資料不足以核算實際成本;單一成功案例也不提供整體失敗率,更不能證明一般 Claude 使用者今天就能穩定產生原創數學。

5. 長期訊號:評估 AI 的單位正在改變

真正值得記住的,不是模型「答對一道超難題」,而是它留下了一條可以被人類閱讀、形式化與反駁的研究鏈。未來衡量前沿模型,可能不再只看封閉題庫分數,而要看它能否把一個開放問題推進到專業共同體願意接手審查的位置。


接下來,三個訊號會決定這項成果站不站得住

  1. 數論專家能否獨立重建關鍵橋樑:尤其是離線零點的 indefinite block、positive index 與 rank–trace 不等式是否忠實接上既有顯式公式。
  2. Lean artifact 是否出現第三方完整重跑紀錄:倉庫已固定 Lean/Mathlib 並提供 comparator、landrun 與 nanoda 步驟;下一層證據是獨立團隊公開保存實際執行版本與 log。
  3. 手稿後續如何修訂:是否出現公開勘誤、正式投稿版本、外部 referee 報告,或數學家指出定義與自然語言主張間的落差。

我的結論很簡單:如果核心證明經更廣泛審查後成立,這會是 AI 參與原創數學研究的重要里程碑;但它的價值恰恰來自能被人類查驗,而不是因為「AI 說它證明了」。Claude 黎曼 ζ 函數研究最值得關注的,是把一個近期文獻留下的條件式缺口,推成了可供共同體檢查的無條件主張。

接著閱讀

左右滑動查看更多推薦

想自己判斷這次突破,最有效的下一步不是再看一篇轉述,而是先讀手稿的 Theorem D 與「What the results are not」兩節,再對照 Lean repository 的 trusted challenge statement;你會立刻看見「67.25%」和「證明黎曼假設」之間究竟隔了多遠。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。