跳到主要內容

AlphaEvolve 矩陣乘法研究解讀:ω 上界降至 2.371177(2026)

最後更新: ·
AlphaEvolve 矩陣乘法研究精選圖,論文表格顯示矩陣乘法指數上界從 2.371339 降至 2.371177。

2026 年 8 月 17 日,來自 Google DeepMind、卡內基美隆大學、哥倫比亞大學與 MIT 的 10 位研究者在 arXiv 發布論文〈Improving the matrix multiplication exponent with modern optimization and AlphaEvolve〉。這項 AlphaEvolve 矩陣乘法研究報告:現代最佳化方法結合程式演化搜尋,把矩陣乘法指數 ω 的最佳已知上界從 2.371339 推進到小於 2.371177。

這句話很容易被改寫成「AI 讓矩陣乘法變快了」,但那會同時漏掉三件事:2.371177 是漸近上界,不是 ω 的已知真值;成果來自人類數學重構、梯度最佳化與 AlphaEvolve 的接力;論文提供的是理論上界,不是實務矩陣乘法的速度證據。而且這仍是 arXiv v1 預印本,本文只按目前公開版本的證據評估。

先把原文放在桌上。點擊下方畫面會在新分頁開啟論文頁面;接下來我們會先釐清數字的數學意義,再拆解 AlphaEvolve 真正做了什麼,最後判斷這個結果的科學價值與限制。

AlphaEvolve 矩陣乘法指數論文的 arXiv 頁面,顯示標題、作者、摘要、2026 年 8 月 17 日提交紀錄與兩個上界數字。
論文的 arXiv 頁面:摘要直接列出 2.371177 與前一紀錄 2.371339。點擊圖片可閱讀原文。

先把 ω 說清楚:2.371177 不是答案,而是上界

若用最直白的方式說,矩陣乘法指數 ω 描述的是:當方形矩陣邊長 n 越來越大時,理論上最少需要多少次算術運算。普通教科書演算法約是 O(n³);精確定義則要求,對任意很小的 ε,都存在 O(nω+ε) 的方法。ω 至少是 2,但它究竟多接近 2,至今不知道。

因此,新論文不是測得「ω = 2.371177」,而是提出一個可行的數學構造,讓已知範圍的天花板再降一點。其核心定理仍是:只要最佳化問題的候選解滿足全部限制,就能推出 ω 不超過相應的 Ω。作者報告另以有理數算術及方向正確的對數界認證後,得到嚴格上界 ω < 2.371177前一篇原始論文所報告的紀錄則是 2.371339。

AlphaEvolve 矩陣乘法論文表 1,列出矩陣乘法指數上界從 2023 年的 2.371866、2024 年 2.371552、2025 年 2.371339,降至本論文 2.371177。
圖/Dupont 等人(2026)論文表 1:近年的最佳已知上界逐步下降;這次比前一紀錄少 0.000162。

0.000162 在小數點後才看得見,卻不是可以直接用「太小所以沒意義」帶過的改進。若暫時忽略常數與低階項,新舊上界的漸近差距會隨 n0.000162 成長;這說明它是一個永久更低的理論上界,但不是牆鐘速度預測。歷史上,Strassen 在 1969 年先把指數降到 2.81 以下,Coppersmith–Winograd 在 1990 年推到 2.376 以下,近年的變化才接到上表。這些數字衡量的是理論邊界,不是今天一張顯示卡的效能升級。

真正先發生的突破:把 2.5 萬個參數擴到近 700 萬個

把功勞全部寫成「AlphaEvolve 找到新紀錄」,會抹掉這篇論文最厚重的人類工作。研究團隊先重寫既有的 combination-loss 最佳化問題:前一個 SOTA 解使用遞迴層級 3、約 2.5 萬個參數;新方法能處理遞迴層級 4、接近 700 萬個參數。

這不是把同一段程式丟上更大的 GPU 而已。作者在 JAX 裡把受非負且總和為一限制的機率分布改以 logits 參數化,再用 softmax 取得分布、用 Sinkhorn–Knopp 處理最大熵分布,搭配隱式微分與 Adam;同時用張量化、phantom nodes 與分階段執行,讓原本難以承受的問題能在 GPU 上最佳化。

光是這套現代梯度方法,論文就報告約 0.000097 的上界改善。加上 AlphaEvolve 後,總改善增至約 0.000162;兩者相減,AlphaEvolve 階段額外貢獻的數值幅度約是 0.000065。這個拆分只能衡量數字的增量,不能拿來分配科學功勞。

AlphaEvolve 做了什麼:它改寫優化器,不是直接寫證明

這項 AlphaEvolve 矩陣乘法研究裡,AlphaEvolve 的角色寫得很窄,也很清楚:

“let AlphaEvolve modify the optimization program”

中文:「讓 AlphaEvolve 修改最佳化程式。」

Dupont 等人,論文第 3.3 節

也就是說,內層的程式負責調整近 700 萬個數學參數;外層的 AlphaEvolve 則讓大型語言模型提出程式碼差異,執行候選優化器、由評估函式打分,再把較好的程式留進資料庫繼續演化。每一代還會從父代找到的最佳數值解開始跑,避免每次從零起步。這比較像「最佳化那個最佳化器」,不是讓聊天機器人憑空吐出一份數學證明。

Google DeepMind 官方 AlphaEvolve 系統圖,顯示人類提供提示設定、模型選擇、評估程式與初始程式,系統再由提示取樣器、LLM 群、評估器與程式資料庫反覆演化。
圖/Google DeepMind:AlphaEvolve 的一般架構。科學家定義初始程式與評分方法,系統在迴圈中產生、執行、比較程式碼。

論文說,一次候選最佳化程式的執行約需一張 GPU 跑 5 小時。這不是整場 AlphaEvolve 搜尋只花 5 個 GPU 小時:總成本還取決於評估了多少候選與演化多少輪,不能從單次執行時間直接推出。把它寫成「一張 GPU、5 小時解題」並不成立。

從浮點數搜尋到數學結論,中間還有一道認證門

數值最佳化器會使用浮點數;但浮點誤差只要讓一條限制看起來「差一點點過關」,就可能把不存在的改進誤認成世界紀錄。作者因此沒有把 AlphaEvolve 的分數直接當成證明,而是另外做認證:

“a separate verification step”

中文:「一個分開的驗證步驟。」

Dupont 等人,論文第 4 節

這一步把候選解四捨五入成有理數,以精確算術重算衍生量,對無法以有理數精確表示的對數則朝安全方向取界。換句話說,AI 與梯度搜尋負責找候選答案,最後能不能跨過定理的門檻,仍由可檢查的數學限制決定。

但截至 2026 年 8 月 19 日,arXiv v1 仍寫著驗證程式與發現解答的 repository 正在準備;本文檢查論文原始封包與 Google DeepMind 的公開 GitHub 後,也尚未找到這項新結果的 verifier 與公開解答。這不表示數學結論錯了,而是外部研究者目前還無法只靠已公開材料,重跑最後一道認證並核對嚴格小數界線。現階段最準確的說法是:論文作者報告已完成精確驗證,但可供獨立重現的關鍵產物仍待公開。

為什麼這不等於明天的 GPU 會更快

漸近指數回答的是 n 趨近無限大時,運算量的成長速度;實務速度還取決於前面的常數、記憶體搬移、平行化、數值穩定性與真正會遇到的矩陣尺寸。這篇論文的證據是數學上界與認證程序,不能替代新 kernel 的牆鐘時間、記憶體、交叉規模或生產環境 benchmark。

這個落差不是挑新論文的毛病,而是理論電腦科學的正常分工。Alman 與 Yu 在另一篇專門研究矩陣乘法領先常數的論文中,就展示過最佳漸近演算法可能背負天文數字般的常數;那個分析不能直接套到這次的新構造,卻足以提醒我們:評估 AlphaEvolve 矩陣乘法研究時,更低的 ω 上界與更快的實際矩陣乘法,是兩項不同證據。

AlphaLab 的判讀:這項成果真正重要在哪裡

判讀一:這是具體的新上界主張,但不是「AI 獨力突破」

若驗證程式與解答通過外部核對,2.371177 就會成為可獨立重現的新上界。可是結果的因果鏈很長:既有定理提供可行解到 ω 上界的橋梁,研究者重新表述並擴充問題、打造可微分的 JAX 優化器,AlphaEvolve 再搜尋更好的程式,最後由精確算術驗證。把整條鏈壓成「AI 發現新數學」,好聽,卻不精確。

判讀二:最有價值的是「搜尋器—評估器—精確驗證」的分工

生成式 AI 能探索大量程式變體,但不能因系統自行宣告正確就採信。這篇工作的設計剛好把兩者拆開:讓不保證正確的系統擴大搜尋,再用研究者事先定義、可以朝精確算術落地的驗證門檻擋住幻覺。等驗證程式與解答公開後,這套流程比「模型說它解出來了」更有科學價值,也比單純跑一個 benchmark 更接近可累積的研究工具。

判讀三:真正的瓶頸仍是人類要會定義什麼叫「對」

AlphaEvolve 可以改寫「怎麼找」,卻沒有自己決定「找什麼」或「為何這能推出定理」。初始程式、目標函式、可行限制、評估器與最後的證明邊界都由領域專家提供。若評分函式漏掉條件,演化系統可能把漏洞當成高分解。因此,這個案例支持的是 AI 放大人類形式化能力,不是數學家已經可以退場。

判讀四:它把既有方法推得更遠,還沒有換掉方法

這次仍在 combination-loss/laser-method 路線內,把更大的既有最佳化問題做得更好。作者自己的結論也很克制:同一路線可能還有小幅進展,但更大的改進多半需要新的數學觀念。也就是說,這個案例顯示 AlphaEvolve 能在已知框架內取得額外改進,還不能證明它能發明下一個框架。

我同意什麼,又存疑什麼?

我同意的:這是 AI 輔助基礎演算法研究的一個具體、可被反駁的成果,不只是概念展示。數字很小不會讓紀錄失去意義;更值得注意的是,人類建立了能把探索結果送進精確認證的管線。

我存疑的:在 verifier、精確解與完整運算紀錄公開前,外界還無法獨立確認最後小數位,也無法評估 AlphaEvolve 搜尋的成本與可重複性。這份論文提供的證據,也推不出「這會立刻加快 AI 訓練」或「AI 已經自己做數學」這兩個更大的敘事。

接下來該看四個訊號,而不是只盯著小數點

  • 驗證產物:作者承諾的 repository、精確候選解與 verifier 是否公開,而且第三方能否得到同一個嚴格上界。
  • 獨立審查:同領域研究者是否確認候選解滿足 Equation 11,以及有理數與對數取界足以推出嚴格小於 2.371177。
  • 搜尋透明度:候選數量、總 GPU 預算、模型版本與最終程式差異是否揭露,讓外界知道哪一部分可以重跑。
  • 下一種證據:後續工作究竟只是再降幾個小數位,還是出現新數學方法;若有人主張實務加速,則必須另外拿出 kernel、尺寸與牆鐘時間。

如果你不是做理論演算法研究,這篇論文不需要改變你的硬體採購或軟體架構;但如果你正在用 AI 做研究,它提供了一條更可靠的設計原則:把創意搜尋交給模型,把「正確」寫成獨立、可重跑、最好能產生證書的閘門。想看另一種「AI 改進 AI」案例,可接著讀 AlphaLab 對遞迴式自我改進推論優化的分析,兩者都提醒我們把內部指標、實際效能與更大的敘事分開。

接著閱讀

左右滑動查看更多推薦

最值得做的下一步很簡單:先收藏論文,等作者公開驗證 repository 後,再回來核對 2.371177 是否能被獨立重現;那會是這項結果從公開主張走向可獨立重現的重要一步。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多兩封,收到週報精選與關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。