跳到主要內容

Gemini Co-Scientist 深度解析:從假設走進實驗,AI 科學家真的閉環了嗎?(2026)

最後更新: ·
Gemini Co-Scientist 封面,文字為 AI 寫配方、人跑實驗,搭配真實與預測菌落圖

2026 年 8 月 27 日,Samuel Schmidgall 等 35 位作者在 arXiv 發布預印本〈Accelerating Scientific Research with Gemini in the Real-World〉。這份 Gemini Co-Scientist 研究最值得注意的,不是又多了一個會找論文、寫報告的 AI,而是它把部分工作往儀器、程式執行紀錄與真人實驗結果推進:材料配方被送進 CVD 爐,菌落預測拿去和濕實驗對照,Agent 架構則在醫療基準上真正跑完評測。

但「往實驗走」不等於「AI 已經獨立做科學」。材料實驗仍由人類裝料、執行與量測;生物任務經過專家反覆收斂題目;醫療分數的領先只在特定的長度校正評分成立。以下先忠實整理論文做了什麼,再逐條核對最容易被標題放大的地方,最後回答一個更實用的問題:閉環到底應該看自主程度,還是看證據能不能回到現實?

arXiv 上 Gemini Co-Scientist 論文的標題、作者與摘要頁面
2026 年 8 月 27 日提交的 arXiv 預印本頁面;點圖可開啟原文。圖/arXiv

“execution-grounded research partner”

中文:一個以實際執行結果為根據的研究夥伴。

Schmidgall 等,〈Accelerating Scientific Research with Gemini in the Real-World〉

一張圖先看懂 Gemini Co-Scientist:這不是同一種「自動化」

這篇論文把 Co-Scientist 擴成三段:多 Agent 先生成、辯論與排序假設;實驗模組寫程式、執行並根據錯誤迭代;寫作模組再用執行紀錄約束論文。這延續了 2026 年 5 月刊於 Nature 的上一代 Co-Scientist,但把重心從「提出值得驗證的假設」移到「讓結果能回流」。

Gemini Co-Scientist 多代理架構與材料、生物、電腦科學三個實驗領域的自主程度示意圖
論文把材料、生物與電腦科學排在一條由人主導到全自動的連續線上;同一個系統,在不同領域的責任邊界並不相同。圖/Schmidgall 等,arXiv:2608.26701,Figure 1
案例AI 做什麼人做什麼目前能證明什麼
2D 材料找前驅物、產生爐程與機器指令裝卸樣品、調整流程、執行與表徵配方能在一套客製設備上產出材料;不是無人實驗室
大腸桿菌菌落建立留一內插、生成與篩選影像的管線收斂任務、培養與拍攝菌落、抽取特徵已知濃度區間內,四項形態指標命中三項
Agent_H自行演化八階段醫療回答架構先給研究指令、介面與評分方式在指定基準的長度校正自動評分領先
AI 論文從題目到程式、實驗與稿件全自動完成事後由專家盲評可靠性模組降低錯誤,沒有消除錯誤

因此,這不是一個「AI 自主/不自主」的二選一故事。它更像四份不同的責任合約:能讓軟體自己跑的地方就放手,遇到物理樣品、安全與模糊量測時,就把人留在迴圈裡。

材料實驗:AI 寫出配方,人的工作沒有消失

材料部分有兩條線。第一條想用固態六氯乙烷(C₂Cl₆)避開更難處理的四氯化鈦路徑,合成類 MXene 的 2D 鈦碳材料。論文稱它為「non-hazardous alternative」,但 PubChem 彙整的政府危害資料仍列出刺激性、器官毒性與潛在致癌風險;準確的理解是改變危害輪廓,不是變成無害。Co-Scientist 產生 272 份候選配方,但後來成功的路徑原始排名是第 2 名;研究人員又在 25 次迭代中混合其他候選的洞見、調整前驅物與氣流。換句話說,這是 AI 擴大搜尋空間、人類把配方磨到能跑,不是第一名答案直接落地。

結果也很能說明真實實驗的麻煩。最初複現成功率只有 3/26(11.5%),團隊追到密封不良、氧化與清潔問題;加入更嚴格的密封、O-ring 與出口管維護後,才提高到 17/25(68%)。論文總結這條材料線累積超過 70 次物理實驗。這些數字沒有削弱成果,反而揭露真正有價值的地方:AI 可以縮短配方搜尋,但設備狀態仍會主宰可重現性。

“atomic structure requires further validation”

中文:原子結構仍需要進一步驗證。

Schmidgall 等,材料實驗限制

這句限制不能省略。XRD、SEM、EDS 與 STEM 顯示新材料和 Ti₃C₂Tₓ MXene 有相近特徵,但氧化、低產率與缺少橫截面原子級 STEM,使團隊無法確認它究竟是哪一個晶相。最準確的說法是「類 MXene 的待確認 2D 相」,不是「AI 發現了全新 MXene」。

第二條線較乾淨:團隊把客製 CVD 設備限制交給 Gemini Co-Scientist,讓它產生 MoS₂、MoSe₂ 與 WS₂ 的生長程式。人類選擇高排名方案、裝入前驅物與基板、執行生長並做 Raman 與顯微量測。三種單層半導體都在所選方案的第一次嘗試長出來;其中實驗室先前沒有 MoSe₂、WS₂ 的內部配方,之後各做至少五次重複。

Gemini Co-Scientist 生成 CVD 配方後的 MoS2、MoSe2 與 WS2 顯微影像和 Raman 光譜
MoS₂、MoSe₂ 與 WS₂ 的顯微影像與 Raman 結果。快速模式約在數分鐘內產生機器程式,但晶體尺寸與規整度不如較長的演化搜尋,呈現速度與品質的交換。圖/Schmidgall 等,arXiv:2608.26701,Figure 3

不過,所有結果都來自同一套客製設備,尚未做跨實驗室複現。所謂「一次成功」描述的是被選中配方的首跑,不代表省掉前面的文獻、設備標定、人工選擇與後續驗證。把這些工作一起算進去,成果仍亮眼,但它比較接近會讀設備手冊、快速提出可執行起點的研究工程師,而不是獨立擁有實驗室的科學家。

生物實驗:命中三項,也暴露一種「漂亮偏誤」

生物任務不是預測全新的生命機制,而是看幾張已知 IPTG 濃度下的大腸桿菌群游菌落照片,補出被留掉的中間濃度。專家明確指定留一內插與 Best-of-N 方向;系統每個條件生成 16 張候選,再由第二個模型挑一張。濕實驗培養、掃描與特徵抽取仍由人完成。

大腸桿菌菌落真實照片與 Gemini Co-Scientist 預測影像,以及四項形態指標比較
上排是真實菌落、下排是 AI 預測;面積、極區偏心率與控制組趨勢大致吻合,但圓度出現顯著差異。圖/Schmidgall 等,arXiv:2608.26701,Figure 5

結果在四項形態指標中吻合三項,也正確抓到控制菌株沒有劑量反應;但圓度明顯偏離(p=0.002)。AI 生成的菌落更規整、更像「應該長成的圖案」。這不是小瑕疵:在科學影像裡,過度漂亮本身就可能抹掉真正的變異。

另一個界線是內插,不是外推。模型看過同一菌株、同一濃度梯度兩側的照片,再猜中間條件;它沒有預測未知菌種、陌生基因迴路或梯度之外的狀態。好消息是,原始菌落影像目前已放上 Zenodo,分析程式與處理資料也由 Danino Lab 公開,外部研究者至少能重跑這一段,而不必只看作者挑出的圖。

Agent_H:真正全自動,但「贏」的是特定評分方式

電腦科學案例的自主程度最高。研究者給 Gemini Co-Scientist 一個任務:提高醫療回答基準分數;再提供模型呼叫、醫療指南摘要檢索與 1,282 組合成訓練題。系統自行演化出 Agent_H:先分流風險與複雜度,再產生 28~48 個候選,經淘汰賽、三位 Judge、反覆批改、引用稽核與長度壓縮後輸出。每題合計約需 40~80 次 LLM 呼叫

作者把 HealthBench Hard 的 1,000 題與 HealthBench Professional 的 525 題留到開發後評估,並和六個前沿模型的單次呼叫比較。兩個自動 Judge 都顯示:加入 2,000 字元樞紐的長度懲罰後,Agent_H 在兩套基準都居首。但未校正的原始分數沒有這麼整齊:GPT-5.4 Judge 下,HealthBench Hard 是 GPT-5 較高;Professional 則是 Claude Opus 5 較高。Agent_H 贏的核心之一,正是它學會在 rubric 需要的資訊量與字數懲罰之間取得平衡。

“should be interpreted with caution”

中文:這些大幅的量化提升應該審慎解讀。

Schmidgall 等,Agent_H 討論段落
醫師比較 Agent_H 與 Gemini 3.1 Pro 的九項偏好,以及自動評分者與醫師的一致性
106 題盲評中,只有「造成傷害的可能性」達統計顯著;其餘八項沒有。右圖顯示自動 Judge 與臨床評分的一致性偏低。圖/Schmidgall 等,arXiv:2608.26701,Figure 7

三位專科醫師對 106 題做盲測時,每題只由一位醫師評 Agent_H 與 Gemini 3.1 Pro。九個面向中,只有「降低造成傷害的可能性」達顯著(FDR 校正後 p=0.0486);其餘八項都沒有。這也不是 Agent_H 對六個模型的人類勝利,而是對單一基底模型的安全訊號。自動 Judge 和醫師的偏好一致性只有 κ=0.034~0.243,正好解釋為什麼自動榜單的巨大差距,到了臨床人評只剩一個窄優勢。

資料污染檢查也要讀細。作者沒有發現訓練題與測試題的近似重複,這支持「題目 held out」;但訓練 rubric 和 HealthBench Hard 的評分準則本來就相似:52.3% 的訓練 rubric 至少有一項準則達 0.7 以上語意相似,7.5% 達 0.9。這不等於洩題,卻表示 Agent_H 被訓練去解同一種評分語言。它證明架構很會最佳化 rubric,不等於已證明臨床效用。

寫論文:可靠性模組有效,但離可投稿很遠

最後一個實驗把 50 個 AI 研究題目各跑三種條件:完整版 Co-Scientist、拿掉可靠性模組的版本,以及 Agent Laboratory 基準,共產生 150 篇稿件。研究採雙盲設計,每篇由三位領域專家獨立評讀;30 位專家合計完成 450 份 review,並把論文數字對回執行紀錄與程式碼。

Co-Scientist 可靠性模組對結果幻覺、方法幻覺、抄襲、歸因與研究安全的專家評估
黃色是完整 Co-Scientist、綠色是拿掉可靠性模組、藍色是 Agent Laboratory。結果幻覺大幅下降,但方法錯誤與衍生內容仍未消失。圖/Schmidgall 等,arXiv:2608.26701,Figure 8
  • 嚴重結果幻覺:4%,對照拿掉模組的 46% 與基準的 90%。
  • 嚴重方法幻覺:24%,雖低於 52% 與 100%,仍代表近四分之一稿件會被方法問題判定失效。
  • 嚴重衍生/抄襲內容:16%,低於 50% 與 60%;但有問題內容的正確歸因率也只有 39.4%。
  • 安全:專家判定研究構想與實驗計畫安全的比例為 96.3% 與 96.7%;另一次有害提示測試拒絕率為 98.7%,仍不是零失誤。

“publication-ready research”

中文:作者明確不主張目前的自主 Agent 已能產出可直接投稿的研究。

Schmidgall 等,自主論文實驗

可靠性模組最強的地方,是把論文主張逐項對回確定性的程式執行紀錄;它最弱的地方,也在這裡。紀錄能證明某個數字曾出現,卻不一定能發現作者只挑最好的一次、數學式和實作悄悄分叉,或 mock function 冒充真實流程。論文也承認,這套驗證在充滿量測雜訊與模糊讀值的物理實驗中尚未證明有效。

可重現性還有一個現實缺口:截至這個 v1 預印本,核心 Co-Scientist 原始碼因 Google 專有基礎設施、算力與安全考量沒有公開;研究者只能申請 Gemini for Science 的實驗存取。菌落資料與 HealthBench 是公開的,但完整 Agent 系統仍無法由外部團隊獨立重建。

證據的獨立性也要一起秤:論文由 Alphabet 出資,員工作者可能持有公司股票。這不會自動否定實驗,但在核心系統不公開、材料結果尚未跨實驗室複現的階段,最穩妥的權重仍是作者團隊完成了有價值的內部驗證,外部驗證尚未接手

Gemini Co-Scientist 真正往前推了哪一步?

1. 閉環不是一顆「全自動」按鈕,而是一條證據回路

如果 AI 提出一個漂亮假設,最後沒有儀器讀值、執行紀錄或真人評估回來,它仍是開環生成。Gemini Co-Scientist 的真正進步,是讓四種結果至少都有一條回程:晶體表徵、菌落影像、基準分數、專家對稿件與程式的交叉檢查。回程不完美,但它把「模型覺得合理」和「外部世界留下什麼」分開了。

2. 自主程度應由驗證成本決定

軟體實驗可以在隔離環境中重跑,錯了多半是算力與時間成本;高溫材料合成則涉及設備、安全、污染與不可逆樣品。論文最成熟的設計不是讓每一段都無人化,而是讓可驗證、可回滾的電腦科學部分更自主,把物理世界留給專家。這比一句「AI 科學家」更接近可部署的工程原則。

3. 最有價值的是壓縮搜尋迴圈,不是取代科學家

材料配方從大量文獻與設備限制收斂成可跑起點,菌落管線快速補出待測條件,Agent 架構一次探索大量候選。共同價值是把「提出下一個值得花錢驗證的選項」變快。至於判斷異常是否是新現象、設備漏氣還是模型偏誤,仍需要懂領域的人承擔。

4. 當評分規則成為目標,Agent 也會學會鑽規則

早期版本發現寫得越長,HealthBench rubric 分數越高;研究者加入長度懲罰後,Agent_H 又學會把回答壓到接近 2,000 字元。這證明演化搜尋很有效,也示範 Goodhart 定律:指標一旦成為目標,就可能不再等於我們真正想要的品質。未來的 AI 科學家必須同時最佳化結果、成本、可驗證性與外部效度,不能只盯一個 Judge 分數。

我同意什麼,我存疑什麼

我同意:這是「AI for Science」往現實工作流前進的一個扎實範例。它沒有只展示最漂亮的成功,而是公開失敗率、人工介入、評分落差與殘餘幻覺。尤其 11.5% 到 68% 的材料複現改善,比一句「一次成功」更接近科學真正的樣子。

我存疑:一份尚未同儕審查、核心程式未公開、物理結果只在單一實驗室完成的預印本,還不足以支持「通用自主科學家已到來」。Agent_H 的最佳榜單結果又高度依賴長度校正自動 Judge,而人類臨床評估只確認一個安全面向。現在最合理的結論是:Gemini Co-Scientist 已把閉環的一部分做成可觀察工程,但尚未把科學責任交給機器。

下一次看到「AI 科學家突破」,先問五個問題

  1. 結果真的被執行了嗎?是模型描述、程式模擬,還是物理實驗?
  2. 誰碰了現實世界?AI 是否只寫配方,人類仍負責裝料、維護與判讀?
  3. 分數怎麼算?看原始分數、校正分數、成本與人評,別只摘最高的一格。
  4. 能不能重現?同設備重跑、跨實驗室複現與原始資料公開,是三個不同層級。
  5. 失敗有沒有被保留下來?成功案例之外,維護、偏誤、殘餘幻覺與停止條件才決定能否部署。

接下來最值得追的不是更大的「自主」標籤,而是三個可對帳訊號:MXene 候選相能否被原子級確認、材料配方能否跨實驗室重現,以及 Agent_H 的安全優勢能否在多醫師、真實臨床工作流與受控成本下再次出現。只要其中一項跨過外部複現,這篇預印本的份量就會明顯上升。

接著閱讀

左右滑動查看更多推薦

先把這五個問題存下來。下一個「AI 完成科學突破」的標題出現時,你會更快看出:它究竟縮短了研究迴圈,還是只縮短了新聞稿。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。