跳到主要內容

OpenAI 100+ 數學難題:顧問團成立,證據還差什麼?(2026)

最後更新: ·
OpenAI 100+ 數學難題與 Navier–Stokes 論文示意圖

2026 年 9 月 21 日,OpenAI 在官網發布數學與人工智慧顧問團公告,同時拋出一個驚人的說法:8 月 28 日開始訓練的內部模型,除了公司先前公布的 Navier–Stokes 結果,還「解決」了超過 100 個橫跨多數數學領域的長期未解問題。這篇文章要拆解的,不是 OpenAI 100+ 數學難題這個數字有多吸睛,而是它目前能證明什麼、還不能證明什麼,以及數學界要如何消化這種可能突然大量湧入的新結果。

OpenAI 數學與人工智慧顧問團公告原文頁面
OpenAI 在 2026 年 9 月 21 日公布顧問團與 100+ 數學難題的主張;公告本身沒有附上 100 題清單與證明。(圖/OpenAI)

先說結論:這不是一則可以直接寫成「AI 已經證明 100 個百年難題」的勝利新聞,也不是一句「沒有全部證明,所以都是炒作」就能打發的公關稿。比較準確的讀法是:OpenAI 公布了高強度的能力訊號,並成立一個可信度很高、但沒有否決權的外部機制;真正可稽核的證據,仍只覆蓋已公開的一小部分。

OpenAI 到底宣布了什麼?

公告有三層訊息。第一,OpenAI 說它在 8 月 28 日開始訓練一個新的內部模型;第二,公司聲稱這個模型已經處理了超過 100 個長期未解問題;第三,因為產出速度連 OpenAI 內部的數學家都感到意外,公司找來九位數學家組成獨立顧問團,協助思考審查、公開方式、成果重要性與證據標準。

“resolved more than 100 long-standing open problems”

中文:解決了超過 100 個長期未解問題。

OpenAI 公告

這句話最需要加註主詞:是 OpenAI 說它的模型已經解決,不是數學共同體已經完成驗證。截至 2026 年 9 月 24 日,這篇公告沒有列出 100 多題的名稱、完整證明、形式化驗證檔案、獨立審稿人或難度分級。因此,「100+」目前是公司自述的待驗證總數,不是外界可以逐項複核的成果表。

為什麼「100 題」不是一個完整的能力刻度?

數學的「未解問題」不是規格一致的測驗題。有些問題卡住幾十年,是因為需要全新的理論;有些只是散落在論文或講義裡、研究者沒有持續追蹤;也有些題目的解法可能不長,但需要找到非常特殊的觀察。把它們全部算成一題,就像把修正錯字、修復安全漏洞與重寫作業系統都算成一個「軟體任務」。數量有訊號,卻不能單獨代表難度、重要性或新穎性。

這也解釋了為什麼 OpenAI 100+ 數學難題真正需要的不是更大的標題,而是一份可以比較的公開帳本。至少要知道每一題的來源與公開日期、此前嘗試、證明長度、關鍵新觀念、形式化程度、外部審查狀態,以及是否只是補完既有方法。沒有這些欄位,100 題可能代表研究生產力的斷層式提升,也可能混合了極少數重大突破與大量難度較低的遺漏題;目前公開資訊無法判定比例。

不能忽略的另一面:OpenAI 已經公開過部分硬證據

懷疑 100+ 的可稽核性,不等於所有成果都只存在於簡報。OpenAI 在 9 月 8 日為 Navier–Stokes 問題發布了技術說明完整論文Lean 程式庫。公司揭露,該次搜尋約動用一萬個並行 agent;Navier–Stokes 部分交換約 270 萬則訊息、產生約 1,300 億個輸出 token。這不是同行共識的替代品,但遠比只有一則能力宣稱更容易檢查。

OpenAI Navier–Stokes 論文中的渦旋縮放示意圖
OpenAI 公開論文 Figure 1 描繪其解法中的縮放與渦旋結構。這是可供外界檢查的單一成果,不是其餘 100+ 題都已獲驗證的證據。(圖/OpenAI)

截至 9 月 24 日,Clay Mathematics Institute 的官方頁面仍把 Navier–Stokes 標為「Active」。這個狀態不等於 Clay 已判定論文錯誤;依其千禧年問題規則,候選解答要先在合格出版物發表、至少經過兩年,並獲得全球數學界普遍接受,才會進入獎項考慮程序。換句話說,形式化證明、論文審閱與共同體接受,是三個不同時鐘。

OpenAI 也在 8 月公開過十項數學進展,附上論文、人類整理的手稿、Lean 憑證或推理紀錄。這建立了一個重要先例:公司知道公開成果需要逐題證據。正因如此,外界有理由期待 100+ 的後續披露至少達到同樣標準。

顧問團很強,但它不是裁判席

新成立的 Advisory Group on Mathematics and Artificial Intelligence 共有九名成員,包括 Timothy Gowers、Martin Hairer、Edward Witten、Ravi Vakil、Camillo De Lellis 等重量級學者。顧問團在自己的獨立網站說明,它可以向任何 AI 公司提供建議、公開自己的建議,而且成員不收 AI 公司報酬。

“operates independently of any AI company”

中文:獨立於任何 AI 公司運作。

AGMAI

但邊界同樣清楚:顧問團沒有決策權,也不負責決定 OpenAI 內部數學研究的速度。它目前的任務,是針對 OpenAI 所報告的大量成果,提供協調公開、審查與溝通的建議。因此最準確的定位是可信的外部程序設計者,不是已經替每一個結果背書的獨立驗證機構,更不是能阻止公司發布的監管者。

數學界真正擔心的,不只是假證明

在公告前十天,數學界已出現一封談 AI 與數學嚴重錯位的公開信。它擔心企業用排行榜與「解了幾題」來定義進步,會把數學從建立理解、培養研究者與共享方法,壓縮成搶先提交答案的競賽。這個批評不是反對計算工具,而是追問:如果答案來得比人類理解更快,誰負責解釋、查錯、辨認真正的新觀念,並給予先前工作正確的歸屬?

值得注意的是,Gowers 沒有簽署那封信。他在9 月 17 日的文章裡同意許多憂慮,卻主張分析不應變成兩個陣營的對撞。這個分歧很有啟發性:眼前不必在「AI 毀掉數學」和「AI 已取代數學家」之間二選一。更實際的問題,是如何把機器的大規模探索能力,接到人類可理解、可複核、可歸因的知識制度上。

AlphaLab 判斷:瓶頸正從找答案,移到驗證與吸收

1. 能力訊號是真的,但精確強度未知

OpenAI 願意為 Navier–Stokes 公開論文、Lean 程式庫與大量計算資訊,又找來能公開發聲且不領公司報酬的數學家,讓「內部確實出現異常強的數學產出」成為合理推論。不過,從一個公開案例外推到超過 100 題都成立,仍跨越了證據缺口。

2. 「100+」現在是待審計庫存,不是成績單

讀者可以把它理解成 OpenAI 報告自己手上有一批候選研究成果。等到題目清單、證明、依賴來源與外部審查逐項公開後,數量才會從行銷訊號變成可比較的研究指標。若最後只有部分通過,也不代表系統沒有價值;它會告訴我們候選生成的命中率與驗證成本。

3. 顧問團改善程序,卻不能取代同行審查

九位學者的加入,最可能改善發布排序、證據格式、重要性判斷與對社群的溝通。它能降低「一次把幾百份證明丟給學界」的外部成本;但成員沒有決策權,顧問身分也不等於共同作者或審稿人,因此不能把名單本身當成 100+ 結果的品質印章。

4. 下一個稀缺資源可能是人類注意力

若模型真的能比研究社群更快產生候選證明,限制就不再只是推理算力,而是哪些結果值得先看、誰來驗證、如何把形式化物件轉成可教學的觀念,以及審查者如何獲得信用。這也是這則新聞最重要的長期意義:AI 可能不是先讓數學家失去問題,而是先讓數學界出現「答案排隊等待理解」的新型積壓。

看到下一批成果時,先檢查這六欄

欄位要問的問題
題目身分何時、由誰提出?真的仍未解嗎?
重要性是核心難題、技術缺口,還是被忽略的小題?
證明資產有完整論文、程式、Lean/其他形式化檔案嗎?
新穎性關鍵步驟是新觀念,還是重組既有方法?
外部狀態誰已逐步檢查?期刊、社群與形式驗證各到哪裡?
生成成本用了多少 agent、token、時間與人類整理工作?

這六欄比「又解了幾題」更能幫助我們判斷 OpenAI 100+ 數學難題的含金量,也能讓未來不同實驗室的結果有共同尺度。真正值得期待的,不只是模型把答案交出來,而是答案能被人類重建、質疑、修正,最後成為共同知識。

接著閱讀

左右滑動查看更多推薦

所以下次再看到「AI 解出 N 個未解問題」,先別急著把 N 當作結論:打開題目清單、證明資產與外部審查狀態,才知道新聞是在描述研究突破,還是在預告一批等待驗證的候選答案。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。