2026 年 10 月 6 日,OpenAI 在官網發布了 〈Sharing AI progress in mathematics〉,公開一批內部前沿模型產生的研究。這次 OpenAI 數學成果的焦點,是一套可供研究者檢視的手稿、形式證明與產出說明;讀懂它,得先分清「有成果可讀」「證明可查」和「學界理解其價值」三件事。

AlphaLab 先前的OpenAI 100+ 數學難題分析追問成果何時能逐項檢視;這篇接續處理 10 月 6 日新釋出的目錄與驗證材料。下面先忠實整理原文與倉庫,再對照獨立數學顧問團及 Lean 文件,最後判斷哪些進展值得期待、哪些結論仍需要逐項驗收。
OpenAI 數學成果公開了什麼?先把單位看清楚
We’re releasing a broad range of new mathematical results produced by an internal frontier model.
中文:我們正在公開由內部前沿模型產生的一系列新數學結果。
OpenAI/2026 年 10 月 6 日公告
原文的訴求很直接:讓 AI 的數學研究能力推動人類知識,同時把材料交到社群手上。它提到諮詢 IAS 的獨立數學與 AI 顧問團、提供 Lean 形式化、公開產出資訊,並承諾資助協助理解這些成果的活動。這是一份研究釋出公告,成果的重要性要從實際內容判斷。
官方倉庫 README截至 2026 年 10 月 7 日列出 722 份手稿、372 個成果家族。家族把主要結果、配套論證、推論與替代證明放在一起,所以不能把 722 直接念成「解掉 722 個獨立難題」。數量是目錄規模;新穎性、正確性和影響力是另外三張成績單。
倉庫也解釋研究背景:既有數學評估逐漸飽和,OpenAI 擴大到開放研究問題。總覽 PDF按學科組織家族,手稿索引再連到個別論文與支援材料。比起只看一個跑分,讀者至少可以追到具體命題與論證;但「可追到」仍不等於「已被學界接受」。
最容易誤讀的例子:準黎曼假設與黎曼假設
索引的第 003 家族聲稱得到包含 ζ 函數在內的 Dirichlet L 函數在 Re(s) > 7/8 的無零點區域,並稱為準黎曼假設。這裡先保留「倉庫聲稱」的歸屬:本次檢視的是釋出材料與驗證規則,沒有逐份重跑數學證明。
Clay Mathematics Institute 的問題說明把黎曼假設描述為:ζ 函數的非平凡零點全部位於實部 1/2 的直線上。排除 7/8 右邊的零點,與把全部非平凡零點定位在 1/2,是不同強度的命題。即使前一項證明成立,也不能把它的名稱縮成「AI 證明了黎曼假設」。
這個例子給一般讀者一個好習慣:遇到著名猜想,先讀定理的範圍與條件。特殊情形、較弱版本、界限改善,都可能有研究價值;價值不需要靠抹掉限定詞才成立。
OpenAI 數學成果的 Lean 證明:編譯成功後還要看什麼?
This collection includes results at different stages of verification. Not all have accompanying Lean formalizations.
中文:這份集合包含驗證進度不同的結果,並非每一項都有配套 Lean 形式化。
OpenAI/math 倉庫 README
Lean 把定義、假設與論證寫成可檢查的形式。對 OpenAI 數學成果,這比一份語氣流暢的 PDF 多出重要的核對入口;但入口要看清楚。Lean 官方驗證指南指出,定理的依賴仍使用 sorry 或含有不完整證明時,編輯器仍可能顯示通過標記。檢查定理依賴的公理,才能辨認是否有未完成的部分或額外假設。
更深一層是「證明了哪一句話」。機器檢查的是形式化後的命題;若它與論文自然語言的意思、原問題的定義或必要條件有差距,通過檢查也不能替這個翻譯落差買單。這不是否定形式證明,而是把信任放在正確位置:定理陳述的對應與證明的有效性,都要驗。
OpenAI 的 Lean 材料附有 形式化目錄與 Comparator 檢查入口。獨立的 Comparator 專案說明在其信任與環境前提下,檢查解答是否證明與 challenge 相同的陳述、只使用允許的公理,並通過核心驗證。若 challenge 自身沒有忠實表達研究問題,這套機器流程仍需要人把關。
因此不要把「有 Lean 檔」壓成一個全倉庫的認證章。讀一項結果,應對上論文、主要定理、形式化宣告、允許假設和驗證配置;完成某一項的檢查,才知道那張收據能支持到哪裡。這也呼應 Agent 回歸測試的觀念:驗收規則本身,必須先對準你想保護的行為。
三小時與 4,000 題:研究成本不是產品承諾
OpenAI 在 README 表示,評估過程向模型提出約 4,000 個問題;平均每項結果使用相當於該內部模型約三小時 ChatGPT Pro thinking 的計算量,並公開 10 份精簡推理摘要。這些都是公司對內部流程的說明,不是 AlphaLab 重現的成績。
「等值算力」不能直接換成你開 ChatGPT 等三小時,就會得到一份研究成果。它也不能直接代表完整研究成本:題目選擇、失敗嘗試、形式化、人工整理與後續理解,是否納入同一平均數,需要另有明確口徑。README 列有固定流程的例外,並說部分零點區域論文經人工修改以改善可讀性;不要把整套產出都寫成同一個無人流程。
同樣不能用 372 或 722 除以 4,000,宣布模型的研究成功率。家族、手稿、題目和篩選後結果的單位不同,題目難度也需要界定。讀研究效率,可以先用 DUST 訓練成本比較的兩把尺:成果品質回答做成什麼,計算與完整流程回答付出了什麼;再用 Mistral 推理強度配對評估理解為何多花算力仍需逐任務對照。
AGMAI 的界線:諮詢不是替全部結果背書
This release is the beginning, not the completion, of the process of human understanding
中文:這次釋出是人類理解過程的開始,而不是完成。
AGMAI/2026 年 10 月 6 日聲明(句中節錄)
獨立顧問團 AGMAI 的同日聲明明確說明:它的諮詢角色不應被解讀為對成果影響力的判斷,或對 OpenAI 產出流程的背書。只有數學社群能進行所需的評估。因此,「OpenAI 諮詢了專家」與「專家確認每一項突破」之間,有一道不能省掉的證據門檻。
這場討論也不只是在找錯。9 月 29 日公開建議要求研究能被理解、來源得到恰當引用、修訂留下可追蹤紀錄,並希望成果存放在不受 AI 實驗室控制的學術倉庫。它也要求公布模型、提示、推理摘要、計算成本與嘗試範圍,支持社群主導的理解工作,且對用封閉模型測試高階數學問題表明反對。
OpenAI 公開 GitHub 材料、計算估計與部分推理摘要,是往可檢視性前進;官方仍將產出模型描述為未釋出的內部模型,並把模型釋出與研究活動資助寫成後續工作。不能把這些承諾算成已完成,也不能把部分公開材料等同整個研究工具已向所有數學家開放。
我的判讀:真正的進展,會留下可接續的理解
我同意:把材料拿出來,讓批評有具體對象
這次值得關注的地方,是論證可以成為檢視的對象。若一項結果能經得起定理對應、證明核對和既有文獻比較,它的價值不會因為作者是模型而消失。反過來,一份看似漂亮的文件,也不會因為出自前沿實驗室就自動成立。
我存疑:手稿規模無法替重要性排序
研究不只是把答案放進倉庫。哪些技術是新的、哪些能簡化別人的證明、哪些會打開後續問題,需要專業判斷。這也是為什麼學界理解不應被當成公告之後的行政步驟:它決定結果能否變成其他人可用的知識。更大量的產出若沒有相應的理解資源,反而會擴大驗收隊列。
下一個可信訊號:從個別結果到可重用的方法
我會追三種後續證據:個別結果的獨立檢查與明確修訂;能把關鍵想法講清楚的社群講義或研討;其他研究者用這些方法完成新工作。它們分別回答「成立嗎」「理解嗎」「有用嗎」。單一明星案例值得追蹤,但不能替全目錄的品質做平均。
對關注 AI 能力的人,這批材料是值得認真研究的訊號;對研究者,最有價值的行動是從自己熟悉的一個家族開始。把它與既有方法比較,核對核心命題和形式化的範圍,再記下你能支持的結論。想理解模型能力與整套工作系統如何分開,可以接著讀 當 AI 開始打造 AI;若需要訓練概念的底座,AI 模型如何學習提供另一層背景。
接著閱讀
左右滑動查看更多推薦
下一次看到「AI 解掉一批數學難題」,先選一項,寫下原問題、釋出的定理、可用證明與獨立評估各在哪裡。讓一份成果回答一個具體問題,才有辦法看見這次 OpenAI 數學成果真正推進了哪一條邊界。





