跳到主要內容

Biohub 虛擬細胞計畫擴大:18 億美元資源投入,離可靠預測還有多遠?(2026)

最後更新: ·
Biohub 虛擬細胞計畫:官方細胞主視覺與「細胞能否先試算?」

2026 年 10 月 7 日,Biohub 在官網發布〈跨國跨領域合作投入近 20 億美元,打造預測與治療疾病 AI 模型所需的基礎資料〉,宣布擴大生物資料合作。Biohub 虛擬細胞計畫的焦點,是先建立能訓練預測模型的量測與資料基礎,再讓研究者更有效地挑選值得進實驗室的問題。

Biohub 虛擬細胞計畫官方公告:2026 年 10 月 7 日擴大資料合作
點圖可閱讀完整公告;截圖/Biohub 官網。

先拆開 18 億美元的組成,再看「虛擬細胞」需要通過什麼考驗,最後判斷這種跨政府、企業與研究機構的合作,能否把規模變成可靠的科學工具。

Biohub 虛擬細胞計畫:18 億美元包含哪些資源?

依 Biohub 本次公告,整體規模為 18 億美元,涵蓋資金、資料、運算與新量測技術。下表列的是公告中的承諾及資源口徑;把它當成當日新到帳現金,會混淆時間與性質。

來源公告規模資源性質
Biohub5 億美元4 月已宣布的創始承諾,含內部量測技術與外部研究支持。
美國能源部(DOE)超過 5 億美元/五年實驗量測、建模及運算等投入。
美國國家衛生研究院(NIH)相關資源來自超過 5 億美元既有聯邦投資協調既有資料集、資料庫與知識資源的貢獻。
Google DeepMind、Isomorphic Labs、Meta合計 3 億美元支持多模態資料與預測生物學技術。

Biohub 的 4 月 29 日原始公告可核對創始承諾的時間與分配:4 億美元用於自身資料生成及量測、影像、工程技術,另 1 億美元支持機構外研究。本次擴大接在既有計畫之上。至於其餘合作方的數字,這裡保留為 Biohub 公告所述,不把承諾改寫成已完成的支出。

公告把 Allen Institute、Broad Institute、Gladstone Institutes、Human Cell Atlas、Human Protein Atlas 與 Wellcome Sanger Institute 列為科學合作群體,並列出 NVIDIA 的運算與技術支持、Renaissance Philanthropy 的募資角色。它們的功能分工也提醒我們:這是一套協調資料生成與使用的基礎設施工程。

原文最值得留下的字:could

An accurate predictive model of biology could dramatically accelerate scientific discovery by enabling scientists to perform experiments digitally.

中文:準確的生物學預測模型,可望讓科學家以數位方式進行實驗,大幅加速科學發現。

Alex Rives,Biohub Head of Science/Biohub 2026 年 10 月 7 日公告

這句話先設了條件:模型必須準確,才談得上加速。原文要推動的是跨機構量測、更多細胞類型與干預條件,以及可共同使用的資料。把計畫的願景讀成今天已交付的通用預測能力,會跳過最重要的驗證。

想像一位研究者有許多候選實驗,時間只夠做其中一小部分。若模型能可靠排序,先選出資訊價值較高的實驗,就可能提高每一次量測的效益。這個用途可以在明確範圍內逐步成立;它與「模型已能預測任意細胞、任意干預」是不同大小的承諾。

量到細胞長什麼樣,與知道它會怎麼變,是兩道問題

觀察資料像拍下一座城市;干預資料則像暫時封路,再記錄交通如何改變。前者告訴你哪些特徵常一起出現,後者幫你辨認施加改變後的反應。預測實驗需要把細胞背景、干預方式和結果連起來,單看漂亮的細胞影像,還不足以回答這個問題。這個比喻描述資料設計,並不把細胞簡化成固定交通規則。

Arc Institute 於 8 月 20 日公布的 2026 Virtual Cell Challenge提供一把外部檢驗尺:參賽模型須預測六種細胞株的 CRISPRi 基因抑制反應,只取得它們未受干預時的表現與待抑制基因名單;該細胞背景的實際干預反應保留作評分真值。這項賽事與 Biohub 本次合作是兩個計畫,但它清楚展示了「跨細胞背景泛化」如何成為可驗的任務。

假如模型只在看過的細胞背景答得好,換到新的細胞背景就失準,實驗室會得到一個範圍有限的工具。有限工具仍可能有價值,前提是清楚標出可用範圍、預測誤差與需要補做的量測。想先補上訓練、驗證與資料分布的基本概念,可以讀 AI 模型如何學習。

AlphaLab 的判讀:資源規模要通過四次轉換

一、把資料變大之前,先讓資料能對上

合作的實際難題,可能藏在細胞命名、干預劑量、量測時間、實驗流程和品質標記。兩份表格即使欄位同名,也可能量的是不同條件;模型若把流程差異當成生物差異,資料越多,錯誤也可能越有自信。

Biohub 公告提出共享標準、共同識別碼與單一存取入口。這個方向值得支持:可追溯的條件與相容的欄位,會決定跨機構資料能否共同使用。更有說服力的下一步,是釋出資料規格、品質檢查與版本紀錄,讓其他團隊能核對、重用及指出問題。

二、把資料量變成準確度,必須留下外部考場

Arc 對 2025 年賽事的總結明確指出,當時的干預預測模型尚未在所有指標上持續超越樸素基線,但在辨認干預與找出差異表現基因等能力上出現進展。這是該賽事、資料與指標下的觀察,不能延伸成所有虛擬細胞研究都無效。

它留下的提醒很實用:能畫出合理輪廓,與能預測某一次改變造成什麼結果,要分開評分。因此我更在意未見細胞背景、未見干預與不同實驗機構下的表現,以及相對簡單基線的增益。用一個總分替所有科研用途下結論,會藏住真正的強項和失敗。AI Evals 入門可幫你把這種判準整理成可重複檢查的問題。

三、把開放願景變成可用資料,還要看存取時間

開放資料的價值,在於其他團隊能查錯、建立不同模型,並測試發起者未想到的用途。當企業也出資參與,資料何時向誰開放,就會影響誰能先建立模型與研究優勢。

Axios 當日對 Rives 的訪問報導稱,商業夥伴對其開發資料享有一年優先存取期,之後公開。這個訪問資訊使「何時開放」成為值得追問的治理條件。

我的判斷是:限定期的先行使用,可以成為企業投入的誘因;它的公共價值取決於到期後是否真正能取得資料,以及授權、文件與品質資訊是否足以支持研究。評估這個安排時,要看一批批資料的實際釋出紀錄,而不是只看「open」這個字。

四、把預測變成科研效率,要回到實驗室對帳

模型幫你選出一個值得做的實驗,與模型讓一種疾病得到有效治療,中間仍隔著不同層次的驗證。可先衡量的是:相同實驗預算下,是否更快找出有資訊價值的問題;預測錯了時,是否能辨認是哪種背景或條件超出能力。

NIH 的 Bio Genesis Mission 說明把 AI、運算、資料及治理放在同一個研究基礎框架中。這可支持政策背景的理解,並不替 Biohub 本次金額或模型成果提供獨立驗證。越接近治療用途,越需要對應層次的生物實驗與臨床證據,不能拿細胞預測分數直接換算病人效益。

Biohub 虛擬細胞計畫:我同意什麼、存疑什麼?

我同意投入可共享的量測與資料基礎。若科研團隊能沿用可靠規格與實驗條件,這筆投入可以同時支持許多模型和研究問題。它的價值有機會跨過單一公司的產品週期。

我對「規模自然帶來通用能力」保留判斷。增加資料與運算,是一個值得驗的研究方向;不同細胞背景能否轉移、哪種量測最有幫助、誤差如何變化,需要實際學習曲線與外部評估來回答。蛋白質任務的成功,也不能單獨替整個細胞的預測能力蓋章。

下一份交付值得看的證據讀者可以下的判斷
資料批次條件、品質、版本、存取日期與授權。是否真的可被其他團隊重用。
模型評估未見背景與干預、簡單基線、逐項指標及失敗案例。可靠預測適用於多大範圍。
實驗對帳先封存預測,再做量測;比較相同預算下的科研成果。是否改善選題與實驗效率。

若你是研究者,先挑一個有可核對結果的窄問題,保存資料條件與簡單基線,再評估新資源是否改善你的工作。若你是一般讀者,下次看到「AI 模擬生命」的新聞,先找清楚三件事:公布了什麼資料、驗了什麼範圍、實驗室實際確認了什麼。Biohub 虛擬細胞計畫值得追蹤的成果,會落在這些可對帳的交付上。

接著閱讀

左右滑動查看更多推薦

下一次更新,先追一批公開資料與一份未見條件評估。能讓別人核對和重用的證據,才會把 18 億美元的研究願景,推進成可靠的預測工具。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。已訂閱?管理主題偏好(會寄登入連結到你的信箱)