2026 年 8 月 27 日,Samuel Schmidgall 等 35 位作者在 arXiv 發布預印本〈Accelerating Scientific Research with Gemini in the Real-World〉。這份 Gemini Co-Scientist 研究最值得注意的,不是又多了一個會找論文、寫報告的 AI,而是它把部分工作往儀器、程式執行紀錄與真人實驗結果推進:材料配方被送進 CVD 爐,菌落預測拿去和濕實驗對照,Agent 架構則在醫療基準上真正跑完評測。
但「往實驗走」不等於「AI 已經獨立做科學」。材料實驗仍由人類裝料、執行與量測;生物任務經過專家反覆收斂題目;醫療分數的領先只在特定的長度校正評分成立。以下先忠實整理論文做了什麼,再逐條核對最容易被標題放大的地方,最後回答一個更實用的問題:閉環到底應該看自主程度,還是看證據能不能回到現實?

“execution-grounded research partner”
中文:一個以實際執行結果為根據的研究夥伴。
Schmidgall 等,〈Accelerating Scientific Research with Gemini in the Real-World〉
一張圖先看懂 Gemini Co-Scientist:這不是同一種「自動化」
這篇論文把 Co-Scientist 擴成三段:多 Agent 先生成、辯論與排序假設;實驗模組寫程式、執行並根據錯誤迭代;寫作模組再用執行紀錄約束論文。這延續了 2026 年 5 月刊於 Nature 的上一代 Co-Scientist,但把重心從「提出值得驗證的假設」移到「讓結果能回流」。

| 案例 | AI 做什麼 | 人做什麼 | 目前能證明什麼 |
|---|---|---|---|
| 2D 材料 | 找前驅物、產生爐程與機器指令 | 裝卸樣品、調整流程、執行與表徵 | 配方能在一套客製設備上產出材料;不是無人實驗室 |
| 大腸桿菌菌落 | 建立留一內插、生成與篩選影像的管線 | 收斂任務、培養與拍攝菌落、抽取特徵 | 已知濃度區間內,四項形態指標命中三項 |
| Agent_H | 自行演化八階段醫療回答架構 | 先給研究指令、介面與評分方式 | 在指定基準的長度校正自動評分領先 |
| AI 論文 | 從題目到程式、實驗與稿件全自動完成 | 事後由專家盲評 | 可靠性模組降低錯誤,沒有消除錯誤 |
因此,這不是一個「AI 自主/不自主」的二選一故事。它更像四份不同的責任合約:能讓軟體自己跑的地方就放手,遇到物理樣品、安全與模糊量測時,就把人留在迴圈裡。
材料實驗:AI 寫出配方,人的工作沒有消失
材料部分有兩條線。第一條想用固態六氯乙烷(C₂Cl₆)避開更難處理的四氯化鈦路徑,合成類 MXene 的 2D 鈦碳材料。論文稱它為「non-hazardous alternative」,但 PubChem 彙整的政府危害資料仍列出刺激性、器官毒性與潛在致癌風險;準確的理解是改變危害輪廓,不是變成無害。Co-Scientist 產生 272 份候選配方,但後來成功的路徑原始排名是第 2 名;研究人員又在 25 次迭代中混合其他候選的洞見、調整前驅物與氣流。換句話說,這是 AI 擴大搜尋空間、人類把配方磨到能跑,不是第一名答案直接落地。
結果也很能說明真實實驗的麻煩。最初複現成功率只有 3/26(11.5%),團隊追到密封不良、氧化與清潔問題;加入更嚴格的密封、O-ring 與出口管維護後,才提高到 17/25(68%)。論文總結這條材料線累積超過 70 次物理實驗。這些數字沒有削弱成果,反而揭露真正有價值的地方:AI 可以縮短配方搜尋,但設備狀態仍會主宰可重現性。
“atomic structure requires further validation”
中文:原子結構仍需要進一步驗證。
Schmidgall 等,材料實驗限制
這句限制不能省略。XRD、SEM、EDS 與 STEM 顯示新材料和 Ti₃C₂Tₓ MXene 有相近特徵,但氧化、低產率與缺少橫截面原子級 STEM,使團隊無法確認它究竟是哪一個晶相。最準確的說法是「類 MXene 的待確認 2D 相」,不是「AI 發現了全新 MXene」。
第二條線較乾淨:團隊把客製 CVD 設備限制交給 Gemini Co-Scientist,讓它產生 MoS₂、MoSe₂ 與 WS₂ 的生長程式。人類選擇高排名方案、裝入前驅物與基板、執行生長並做 Raman 與顯微量測。三種單層半導體都在所選方案的第一次嘗試長出來;其中實驗室先前沒有 MoSe₂、WS₂ 的內部配方,之後各做至少五次重複。

不過,所有結果都來自同一套客製設備,尚未做跨實驗室複現。所謂「一次成功」描述的是被選中配方的首跑,不代表省掉前面的文獻、設備標定、人工選擇與後續驗證。把這些工作一起算進去,成果仍亮眼,但它比較接近會讀設備手冊、快速提出可執行起點的研究工程師,而不是獨立擁有實驗室的科學家。
生物實驗:命中三項,也暴露一種「漂亮偏誤」
生物任務不是預測全新的生命機制,而是看幾張已知 IPTG 濃度下的大腸桿菌群游菌落照片,補出被留掉的中間濃度。專家明確指定留一內插與 Best-of-N 方向;系統每個條件生成 16 張候選,再由第二個模型挑一張。濕實驗培養、掃描與特徵抽取仍由人完成。

結果在四項形態指標中吻合三項,也正確抓到控制菌株沒有劑量反應;但圓度明顯偏離(p=0.002)。AI 生成的菌落更規整、更像「應該長成的圖案」。這不是小瑕疵:在科學影像裡,過度漂亮本身就可能抹掉真正的變異。
另一個界線是內插,不是外推。模型看過同一菌株、同一濃度梯度兩側的照片,再猜中間條件;它沒有預測未知菌種、陌生基因迴路或梯度之外的狀態。好消息是,原始菌落影像目前已放上 Zenodo,分析程式與處理資料也由 Danino Lab 公開,外部研究者至少能重跑這一段,而不必只看作者挑出的圖。
Agent_H:真正全自動,但「贏」的是特定評分方式
電腦科學案例的自主程度最高。研究者給 Gemini Co-Scientist 一個任務:提高醫療回答基準分數;再提供模型呼叫、醫療指南摘要檢索與 1,282 組合成訓練題。系統自行演化出 Agent_H:先分流風險與複雜度,再產生 28~48 個候選,經淘汰賽、三位 Judge、反覆批改、引用稽核與長度壓縮後輸出。每題合計約需 40~80 次 LLM 呼叫。
作者把 HealthBench Hard 的 1,000 題與 HealthBench Professional 的 525 題留到開發後評估,並和六個前沿模型的單次呼叫比較。兩個自動 Judge 都顯示:加入 2,000 字元樞紐的長度懲罰後,Agent_H 在兩套基準都居首。但未校正的原始分數沒有這麼整齊:GPT-5.4 Judge 下,HealthBench Hard 是 GPT-5 較高;Professional 則是 Claude Opus 5 較高。Agent_H 贏的核心之一,正是它學會在 rubric 需要的資訊量與字數懲罰之間取得平衡。
“should be interpreted with caution”
中文:這些大幅的量化提升應該審慎解讀。
Schmidgall 等,Agent_H 討論段落

三位專科醫師對 106 題做盲測時,每題只由一位醫師評 Agent_H 與 Gemini 3.1 Pro。九個面向中,只有「降低造成傷害的可能性」達顯著(FDR 校正後 p=0.0486);其餘八項都沒有。這也不是 Agent_H 對六個模型的人類勝利,而是對單一基底模型的安全訊號。自動 Judge 和醫師的偏好一致性只有 κ=0.034~0.243,正好解釋為什麼自動榜單的巨大差距,到了臨床人評只剩一個窄優勢。
資料污染檢查也要讀細。作者沒有發現訓練題與測試題的近似重複,這支持「題目 held out」;但訓練 rubric 和 HealthBench Hard 的評分準則本來就相似:52.3% 的訓練 rubric 至少有一項準則達 0.7 以上語意相似,7.5% 達 0.9。這不等於洩題,卻表示 Agent_H 被訓練去解同一種評分語言。它證明架構很會最佳化 rubric,不等於已證明臨床效用。
寫論文:可靠性模組有效,但離可投稿很遠
最後一個實驗把 50 個 AI 研究題目各跑三種條件:完整版 Co-Scientist、拿掉可靠性模組的版本,以及 Agent Laboratory 基準,共產生 150 篇稿件。研究採雙盲設計,每篇由三位領域專家獨立評讀;30 位專家合計完成 450 份 review,並把論文數字對回執行紀錄與程式碼。

- 嚴重結果幻覺:4%,對照拿掉模組的 46% 與基準的 90%。
- 嚴重方法幻覺:24%,雖低於 52% 與 100%,仍代表近四分之一稿件會被方法問題判定失效。
- 嚴重衍生/抄襲內容:16%,低於 50% 與 60%;但有問題內容的正確歸因率也只有 39.4%。
- 安全:專家判定研究構想與實驗計畫安全的比例為 96.3% 與 96.7%;另一次有害提示測試拒絕率為 98.7%,仍不是零失誤。
“publication-ready research”
中文:作者明確不主張目前的自主 Agent 已能產出可直接投稿的研究。
Schmidgall 等,自主論文實驗
可靠性模組最強的地方,是把論文主張逐項對回確定性的程式執行紀錄;它最弱的地方,也在這裡。紀錄能證明某個數字曾出現,卻不一定能發現作者只挑最好的一次、數學式和實作悄悄分叉,或 mock function 冒充真實流程。論文也承認,這套驗證在充滿量測雜訊與模糊讀值的物理實驗中尚未證明有效。
可重現性還有一個現實缺口:截至這個 v1 預印本,核心 Co-Scientist 原始碼因 Google 專有基礎設施、算力與安全考量沒有公開;研究者只能申請 Gemini for Science 的實驗存取。菌落資料與 HealthBench 是公開的,但完整 Agent 系統仍無法由外部團隊獨立重建。
證據的獨立性也要一起秤:論文由 Alphabet 出資,員工作者可能持有公司股票。這不會自動否定實驗,但在核心系統不公開、材料結果尚未跨實驗室複現的階段,最穩妥的權重仍是作者團隊完成了有價值的內部驗證,外部驗證尚未接手。
Gemini Co-Scientist 真正往前推了哪一步?
1. 閉環不是一顆「全自動」按鈕,而是一條證據回路
如果 AI 提出一個漂亮假設,最後沒有儀器讀值、執行紀錄或真人評估回來,它仍是開環生成。Gemini Co-Scientist 的真正進步,是讓四種結果至少都有一條回程:晶體表徵、菌落影像、基準分數、專家對稿件與程式的交叉檢查。回程不完美,但它把「模型覺得合理」和「外部世界留下什麼」分開了。
2. 自主程度應由驗證成本決定
軟體實驗可以在隔離環境中重跑,錯了多半是算力與時間成本;高溫材料合成則涉及設備、安全、污染與不可逆樣品。論文最成熟的設計不是讓每一段都無人化,而是讓可驗證、可回滾的電腦科學部分更自主,把物理世界留給專家。這比一句「AI 科學家」更接近可部署的工程原則。
3. 最有價值的是壓縮搜尋迴圈,不是取代科學家
材料配方從大量文獻與設備限制收斂成可跑起點,菌落管線快速補出待測條件,Agent 架構一次探索大量候選。共同價值是把「提出下一個值得花錢驗證的選項」變快。至於判斷異常是否是新現象、設備漏氣還是模型偏誤,仍需要懂領域的人承擔。
4. 當評分規則成為目標,Agent 也會學會鑽規則
早期版本發現寫得越長,HealthBench rubric 分數越高;研究者加入長度懲罰後,Agent_H 又學會把回答壓到接近 2,000 字元。這證明演化搜尋很有效,也示範 Goodhart 定律:指標一旦成為目標,就可能不再等於我們真正想要的品質。未來的 AI 科學家必須同時最佳化結果、成本、可驗證性與外部效度,不能只盯一個 Judge 分數。
我同意什麼,我存疑什麼
我同意:這是「AI for Science」往現實工作流前進的一個扎實範例。它沒有只展示最漂亮的成功,而是公開失敗率、人工介入、評分落差與殘餘幻覺。尤其 11.5% 到 68% 的材料複現改善,比一句「一次成功」更接近科學真正的樣子。
我存疑:一份尚未同儕審查、核心程式未公開、物理結果只在單一實驗室完成的預印本,還不足以支持「通用自主科學家已到來」。Agent_H 的最佳榜單結果又高度依賴長度校正自動 Judge,而人類臨床評估只確認一個安全面向。現在最合理的結論是:Gemini Co-Scientist 已把閉環的一部分做成可觀察工程,但尚未把科學責任交給機器。
下一次看到「AI 科學家突破」,先問五個問題
- 結果真的被執行了嗎?是模型描述、程式模擬,還是物理實驗?
- 誰碰了現實世界?AI 是否只寫配方,人類仍負責裝料、維護與判讀?
- 分數怎麼算?看原始分數、校正分數、成本與人評,別只摘最高的一格。
- 能不能重現?同設備重跑、跨實驗室複現與原始資料公開,是三個不同層級。
- 失敗有沒有被保留下來?成功案例之外,維護、偏誤、殘餘幻覺與停止條件才決定能否部署。
接下來最值得追的不是更大的「自主」標籤,而是三個可對帳訊號:MXene 候選相能否被原子級確認、材料配方能否跨實驗室重現,以及 Agent_H 的安全優勢能否在多醫師、真實臨床工作流與受控成本下再次出現。只要其中一項跨過外部複現,這篇預印本的份量就會明顯上升。
接著閱讀
左右滑動查看更多推薦
先把這五個問題存下來。下一個「AI 完成科學突破」的標題出現時,你會更快看出:它究竟縮短了研究迴圈,還是只縮短了新聞稿。






