2026 年 8 月 17 日,來自 Google DeepMind、卡內基美隆大學、哥倫比亞大學與 MIT 的 10 位研究者在 arXiv 發布論文〈Improving the matrix multiplication exponent with modern optimization and AlphaEvolve〉。這項 AlphaEvolve 矩陣乘法研究報告:現代最佳化方法結合程式演化搜尋,把矩陣乘法指數 ω 的最佳已知上界從 2.371339 推進到小於 2.371177。
這句話很容易被改寫成「AI 讓矩陣乘法變快了」,但那會同時漏掉三件事:2.371177 是漸近上界,不是 ω 的已知真值;成果來自人類數學重構、梯度最佳化與 AlphaEvolve 的接力;論文提供的是理論上界,不是實務矩陣乘法的速度證據。而且這仍是 arXiv v1 預印本,本文只按目前公開版本的證據評估。
先把原文放在桌上。點擊下方畫面會在新分頁開啟論文頁面;接下來我們會先釐清數字的數學意義,再拆解 AlphaEvolve 真正做了什麼,最後判斷這個結果的科學價值與限制。

先把 ω 說清楚:2.371177 不是答案,而是上界
若用最直白的方式說,矩陣乘法指數 ω 描述的是:當方形矩陣邊長 n 越來越大時,理論上最少需要多少次算術運算。普通教科書演算法約是 O(n³);精確定義則要求,對任意很小的 ε,都存在 O(nω+ε) 的方法。ω 至少是 2,但它究竟多接近 2,至今不知道。
因此,新論文不是測得「ω = 2.371177」,而是提出一個可行的數學構造,讓已知範圍的天花板再降一點。其核心定理仍是:只要最佳化問題的候選解滿足全部限制,就能推出 ω 不超過相應的 Ω。作者報告另以有理數算術及方向正確的對數界認證後,得到嚴格上界 ω < 2.371177;前一篇原始論文所報告的紀錄則是 2.371339。

0.000162 在小數點後才看得見,卻不是可以直接用「太小所以沒意義」帶過的改進。若暫時忽略常數與低階項,新舊上界的漸近差距會隨 n0.000162 成長;這說明它是一個永久更低的理論上界,但不是牆鐘速度預測。歷史上,Strassen 在 1969 年先把指數降到 2.81 以下,Coppersmith–Winograd 在 1990 年推到 2.376 以下,近年的變化才接到上表。這些數字衡量的是理論邊界,不是今天一張顯示卡的效能升級。
真正先發生的突破:把 2.5 萬個參數擴到近 700 萬個
把功勞全部寫成「AlphaEvolve 找到新紀錄」,會抹掉這篇論文最厚重的人類工作。研究團隊先重寫既有的 combination-loss 最佳化問題:前一個 SOTA 解使用遞迴層級 3、約 2.5 萬個參數;新方法能處理遞迴層級 4、接近 700 萬個參數。
這不是把同一段程式丟上更大的 GPU 而已。作者在 JAX 裡把受非負且總和為一限制的機率分布改以 logits 參數化,再用 softmax 取得分布、用 Sinkhorn–Knopp 處理最大熵分布,搭配隱式微分與 Adam;同時用張量化、phantom nodes 與分階段執行,讓原本難以承受的問題能在 GPU 上最佳化。
光是這套現代梯度方法,論文就報告約 0.000097 的上界改善。加上 AlphaEvolve 後,總改善增至約 0.000162;兩者相減,AlphaEvolve 階段額外貢獻的數值幅度約是 0.000065。這個拆分只能衡量數字的增量,不能拿來分配科學功勞。
AlphaEvolve 做了什麼:它改寫優化器,不是直接寫證明
這項 AlphaEvolve 矩陣乘法研究裡,AlphaEvolve 的角色寫得很窄,也很清楚:
“let AlphaEvolve modify the optimization program”
中文:「讓 AlphaEvolve 修改最佳化程式。」
— Dupont 等人,論文第 3.3 節
也就是說,內層的程式負責調整近 700 萬個數學參數;外層的 AlphaEvolve 則讓大型語言模型提出程式碼差異,執行候選優化器、由評估函式打分,再把較好的程式留進資料庫繼續演化。每一代還會從父代找到的最佳數值解開始跑,避免每次從零起步。這比較像「最佳化那個最佳化器」,不是讓聊天機器人憑空吐出一份數學證明。

論文說,一次候選最佳化程式的執行約需一張 GPU 跑 5 小時。這不是整場 AlphaEvolve 搜尋只花 5 個 GPU 小時:總成本還取決於評估了多少候選與演化多少輪,不能從單次執行時間直接推出。把它寫成「一張 GPU、5 小時解題」並不成立。
從浮點數搜尋到數學結論,中間還有一道認證門
數值最佳化器會使用浮點數;但浮點誤差只要讓一條限制看起來「差一點點過關」,就可能把不存在的改進誤認成世界紀錄。作者因此沒有把 AlphaEvolve 的分數直接當成證明,而是另外做認證:
“a separate verification step”
中文:「一個分開的驗證步驟。」
— Dupont 等人,論文第 4 節
這一步把候選解四捨五入成有理數,以精確算術重算衍生量,對無法以有理數精確表示的對數則朝安全方向取界。換句話說,AI 與梯度搜尋負責找候選答案,最後能不能跨過定理的門檻,仍由可檢查的數學限制決定。
但截至 2026 年 8 月 19 日,arXiv v1 仍寫著驗證程式與發現解答的 repository 正在準備;本文檢查論文原始封包與 Google DeepMind 的公開 GitHub 後,也尚未找到這項新結果的 verifier 與公開解答。這不表示數學結論錯了,而是外部研究者目前還無法只靠已公開材料,重跑最後一道認證並核對嚴格小數界線。現階段最準確的說法是:論文作者報告已完成精確驗證,但可供獨立重現的關鍵產物仍待公開。
為什麼這不等於明天的 GPU 會更快
漸近指數回答的是 n 趨近無限大時,運算量的成長速度;實務速度還取決於前面的常數、記憶體搬移、平行化、數值穩定性與真正會遇到的矩陣尺寸。這篇論文的證據是數學上界與認證程序,不能替代新 kernel 的牆鐘時間、記憶體、交叉規模或生產環境 benchmark。
這個落差不是挑新論文的毛病,而是理論電腦科學的正常分工。Alman 與 Yu 在另一篇專門研究矩陣乘法領先常數的論文中,就展示過最佳漸近演算法可能背負天文數字般的常數;那個分析不能直接套到這次的新構造,卻足以提醒我們:評估 AlphaEvolve 矩陣乘法研究時,更低的 ω 上界與更快的實際矩陣乘法,是兩項不同證據。
AlphaLab 的判讀:這項成果真正重要在哪裡
判讀一:這是具體的新上界主張,但不是「AI 獨力突破」
若驗證程式與解答通過外部核對,2.371177 就會成為可獨立重現的新上界。可是結果的因果鏈很長:既有定理提供可行解到 ω 上界的橋梁,研究者重新表述並擴充問題、打造可微分的 JAX 優化器,AlphaEvolve 再搜尋更好的程式,最後由精確算術驗證。把整條鏈壓成「AI 發現新數學」,好聽,卻不精確。
判讀二:最有價值的是「搜尋器—評估器—精確驗證」的分工
生成式 AI 能探索大量程式變體,但不能因系統自行宣告正確就採信。這篇工作的設計剛好把兩者拆開:讓不保證正確的系統擴大搜尋,再用研究者事先定義、可以朝精確算術落地的驗證門檻擋住幻覺。等驗證程式與解答公開後,這套流程比「模型說它解出來了」更有科學價值,也比單純跑一個 benchmark 更接近可累積的研究工具。
判讀三:真正的瓶頸仍是人類要會定義什麼叫「對」
AlphaEvolve 可以改寫「怎麼找」,卻沒有自己決定「找什麼」或「為何這能推出定理」。初始程式、目標函式、可行限制、評估器與最後的證明邊界都由領域專家提供。若評分函式漏掉條件,演化系統可能把漏洞當成高分解。因此,這個案例支持的是 AI 放大人類形式化能力,不是數學家已經可以退場。
判讀四:它把既有方法推得更遠,還沒有換掉方法
這次仍在 combination-loss/laser-method 路線內,把更大的既有最佳化問題做得更好。作者自己的結論也很克制:同一路線可能還有小幅進展,但更大的改進多半需要新的數學觀念。也就是說,這個案例顯示 AlphaEvolve 能在已知框架內取得額外改進,還不能證明它能發明下一個框架。
我同意什麼,又存疑什麼?
我同意的:這是 AI 輔助基礎演算法研究的一個具體、可被反駁的成果,不只是概念展示。數字很小不會讓紀錄失去意義;更值得注意的是,人類建立了能把探索結果送進精確認證的管線。
我存疑的:在 verifier、精確解與完整運算紀錄公開前,外界還無法獨立確認最後小數位,也無法評估 AlphaEvolve 搜尋的成本與可重複性。這份論文提供的證據,也推不出「這會立刻加快 AI 訓練」或「AI 已經自己做數學」這兩個更大的敘事。
接下來該看四個訊號,而不是只盯著小數點
- 驗證產物:作者承諾的 repository、精確候選解與 verifier 是否公開,而且第三方能否得到同一個嚴格上界。
- 獨立審查:同領域研究者是否確認候選解滿足 Equation 11,以及有理數與對數取界足以推出嚴格小於 2.371177。
- 搜尋透明度:候選數量、總 GPU 預算、模型版本與最終程式差異是否揭露,讓外界知道哪一部分可以重跑。
- 下一種證據:後續工作究竟只是再降幾個小數位,還是出現新數學方法;若有人主張實務加速,則必須另外拿出 kernel、尺寸與牆鐘時間。
如果你不是做理論演算法研究,這篇論文不需要改變你的硬體採購或軟體架構;但如果你正在用 AI 做研究,它提供了一條更可靠的設計原則:把創意搜尋交給模型,把「正確」寫成獨立、可重跑、最好能產生證書的閘門。想看另一種「AI 改進 AI」案例,可接著讀 AlphaLab 對遞迴式自我改進與推論優化的分析,兩者都提醒我們把內部指標、實際效能與更大的敘事分開。
接著閱讀
左右滑動查看更多推薦
最值得做的下一步很簡單:先收藏論文,等作者公開驗證 repository 後,再回來核對 2.371177 是否能被獨立重現;那會是這項結果從公開主張走向可獨立重現的重要一步。






