2026 年 10 月 2 日,Meta AI Research 在官網發布〈Solving Open Research Problems Together〉,展示數學家與 Muse Spark 合作完成的六篇研究論文。這批 Muse Spark 數學論文 最值得追問的,並不是模型「會不會做數學」,而是它在哪些環節提供了幫助、最後由誰承擔證明責任,以及已有其他團隊先提出哪些答案。

先看原文的六項成果,再核對論文與同期研究,最後判斷這件事對 AI 輔助研究意味著什麼。
Muse Spark 數學論文:六篇成果怎麼來的?
Today, we’re sharing six such papers from that collaboration. Five present answers to previously open research questions.
中文:Meta 說,這次公開六篇合作論文,其中五篇回答此前尚未解決的研究問題。
Meta AI Research,〈Solving Open Research Problems Together〉
原文說,研究團隊使用 Muse Spark 1.1 與 1.2 的 Thinking Mode,在一般 meta.ai 聊天介面中探索,不使用特製研究框架。數學家主導選題與論證,另一組數學家檢查成果;論文以邊註標示人類主寫和 AI 輔助段落。這是人類研究者與模型合作的作品,不能改寫成模型獨力產出六個證明。
| 領域 | 論文的具體成果 | 模型扮演的角色 |
|---|---|---|
| 機率 | 給出高斯點橢球精確擬合的臨界門檻;門檻正上方與正下方有定論,恰在門檻上的情形未涵蓋。 | 探索證明策略、修訂論證。 |
| 偏微分方程 | 在徑向、負能量等條件下,證明一類波動解會在有限時間內崩潰。 | 協助計算和檢驗候選論證。 |
| 群論 | 以 384 階群反駁「半阿貝爾群必為單項群」的猜想。 | 產生 GAP 搜尋程式尋找反例。 |
| 最佳化 | 刻畫一類三邊循環鬆弛何時精確:三個兩兩交集區都各只有一個元素。 | 提出機率化視角、反例與證明方向。 |
| 算術物理 | 把曲線上的高度函數與弦論雙點函數接起來。 | 提出候選證明並草擬技術段落。 |
| 演化代數 | 用三維反例推翻原猜想,並提出以子空間為核心的替代條件。 | 提出反例及候選刻畫。 |
這六篇的「解題」性質並不相同:有門檻定理、有限時間爆破解析、兩個反例、鬆弛條件,也有跨領域等式的建立。原文的「五篇回答此前開放問題」是 Meta 對這批工作的分類,不能把每篇都簡化成同一種競賽式通關。
三幅圖說明:模型提供線索,證明仍要收斂到可檢查的命題
橢球擬合:臨界值不是「AI 準確率」
在高維空間放入隨機高斯點,問題是能否找到一個橢球精確穿過每個點。Meta 論文摘要把門檻寫為點數約等於維度平方的四分之一:低於門檻時,高機率存在精確擬合;高於門檻時,高機率不存在。這是特定數學模型中的漸近定理,不是 Muse Spark 解題成功率。

波動崩潰:結論只在論文條件內成立
第二篇論文處理的是質量臨界雙諧非線性薛丁格方程。論文摘要明定徑向、負能量、至少二維等條件;圖示中的波峰變高只是幫讀者想像「有限時間爆破」,並非普遍物理系統都會如此。

群論:程式找到候選者,數學家核對性質
在群論論文中,Muse Spark 寫出 GAP 搜尋程式,團隊找到 SmallGroup(384, 20127)。論文摘要列出 384 階反例;完整 PDF 還提供搜尋及檢查輸出。程式可以縮小搜尋範圍,但「找到一個群」與「證明它具備所需性質」是兩個不同步驟。

先後順序要對帳:至少三個問題已有獨立進展
最關鍵的對照來自高斯橢球問題。Misiakiewicz 與 Wen 的預印本於 2026 年 8 月 10 日公開,摘要明確宣稱證明同一個銳利門檻。另有 8 月 12 日的團隊工作,以及 8 月 27 日更廣泛的普適性結果。Meta 論文本身逐一列明這些同期成果。因此「Meta 團隊也得到一份不同路徑的證明」成立;「Meta 首先解決這題」則不成立。
群論一題,Meta 論文記錄 AI agent Nilradical 在 9 月 16 日提出另一個反例。演化代數一題,Hu 與 Wen 的預印本也提出反例。獨立撞題既不抹去 Meta 論文中不同方法或附加定理的價值,也提醒我們區分「對問題有貢獻」與「第一次回答問題」。
這批研究真正顯示了什麼?
我同意:把模型放進專家研究流程,確實能擴大可嘗試的思路。這六篇提供比數學競賽分數更具體的案例:生成搜尋程式、構造反例、探索證明、連結兩個領域。論文公開 AI 使用聲明和人類/AI 段落標記,也讓外界有材料追查責任鏈。這與 AI 參與改進研發流程的討論一樣,關鍵都在可追溯的人機分工。
我存疑:六篇完成的成果,無法推出模型面對任意未解問題的成功率。選題、研究者投入、修正次數與驗證成本都影響結果;只看成品,不能算出平均每題需要多少嘗試,更不能把人類複核的工作算成模型單獨能力。另一篇模型評測分析也提醒我們,單一漂亮分數背後需要看樣本與比較條件。論文與預印本提供可檢查的主張,但本文沒有對全部數學證明進行獨立形式化驗證。
更值得觀察的是下一輪研究能否同時公開問題提出時間、模型版本、失敗路徑、修正紀錄與獨立審查結果。若這些資訊越來越完整,我們才能把「有幫助的研究搭檔」與「穩定可靠的解題系統」分得更清楚。對正在用 AI 做研究的人,先把模型當成候選想法與程式的產生器,再讓領域專家檢查每個關鍵推論,並主動搜尋是否已有同期成果。
接著閱讀
左右滑動查看更多推薦






