2026 年 9 月 17 日,Anthropic 發布〈How Claude is uplifting biomolecular modeling〉與 139 頁技術報告:一個未公開型號的內部研究模型,在不到四週內,為超過 30 個開源生物分子模型做出 36 套推論優化。這次 Claude 生物分子模型加速最吸睛的數字是 4.1 倍,但真正值得追問的是:程式跑快了,科學證據也同步變強了嗎?
答案一半令人振奮、一半必須踩煞車。Anthropic 展示了 AI 可以替一整片陌生科學工具鏈改 kernel、排程與記憶體路徑;同一份報告也顯示,當輸入推到 31,140~70,320 個殘基時,七次運算雖然都跑完,預測結構卻全部崩塌。它拆掉了算力的牆,牆後面仍是模型尚未學會的生物學。

Claude 改造的不是一個模型,而是一整套工具鏈
這不是 Claude 取代 AlphaFold 類模型來預測蛋白質。它扮演的是替科學模型「改引擎」的工程師:找出重複計算、預先處理不變分支、減少 CPU 與 GPU 之間搬資料,用 CUDA Graph 降低 Python 開銷,再替昂貴的三角注意力與三角乘法撰寫 GPU kernel。
目前官網連結的技術報告把 36 套最佳化 package 分成六類:14 套共同摺疊與結構預測、3 套 hallucination、6 套結構生成、3 套 inverse folding、7 套基因體模型,以及 3 套蛋白質語言模型。36 是套件數,不是 36 個全新的模型架構;其中包含同一模型的不同 checkpoint、權重或實作。
負責工作的 Claude 只被描述為內部通用研究模型,沒有公開產品名。報告說主要監督者是兩名熟悉生物分子建模、但沒有推論最佳化或 kernel 工程背景的 Anthropic 技術人員;報告未提供可把「不到四週」換算成人類工時的完整呼叫、重試與介入紀錄。因此,這個時程是重要的工程成果,卻不是一份已控制其他變因的生產力實驗。
Exact、Fast、Big,其實回答三個不同問題
要理解這次 Claude 生物分子模型加速,先別把三種模式混成一句「更快又一樣準」。
- Exact 解決執行效率:改排程、快取與 kernel,目標是在指定的確定性檢查中重現 baseline 輸出。報告在 11 個受檢結構設定中有 10 個通過 bit-identical 檢查;這不是所有輸入與正式環境都永遠逐位元相同的保證。
- Fast 解決吞吐量:允許較低精度或不同捨入路徑,再以模型專屬 tolerance 或 seed-to-seed 波動當護欄。4.1 倍指的是 13 個結構預測模型在 H100 80 GB 上的 forward call 平均,不是 30 多個模型的端到端研究流程。
- Big 解決容量:把大型中間 tensor 分塊,或把 pair representation 拆到同一台主機的多張 GPU。輸入能放進記憶體,不代表模型就能給出正確答案。
這三層差異也適用於一般 LLM 推論引擎:執行路徑、記憶體上限與模型能力彼此相關,卻不能互相替代。

4.1 倍更快,不等於精度完全沒有代價
Anthropic 用 FoldBench-Lite 檢查結構介面品質。13 個模型設定合計形成 1,925 組 model–target pairs;這不是 1,925 個彼此獨立的標的,而是相同 targets 在不同模型下重複出現。判定「可接受」使用 DockQ ≥ 0.23,也就是 CAPRI 分類中最低的 acceptable 門檻,不等於功能、結合力或濕實驗成功。
pooled 可接受介面比例是 Default 54.8%、Exact 55.0%、Fast 54.5%、Big 54.2%。三個變化的 95% 信賴區間都包含零,所以這組測試沒有偵測到可清楚區分於零的整體差異;但「未達統計顯著」不等於證明完全無損。部分單模型下降 2.2~3.5 個百分點,報告也明確說不能排除小幅退步。

10,761 tokens 是突破,也是經過挑選的成功案例
Big 模式確實讓大型結構預測進入新的可計算範圍。報告列出六個超過 10,000 tokens、符合預設準確標準的案例,包括 human complex I、70S ribosome 與 TRiC–tubulin;最大為 10,761 tokens。它們使用的是一台含八張 H100 或 B200 的節點,不是單張 GPU。
但 Figure 7 的 20 個展示結果,是從 20 個 assemblies、190 次已記錄預測中評分後挑出。失敗的 runs 會換 seed 重跑,部分 tile 顯示最佳 seed;六個超過 10,000 tokens 的準確案例全部使用結構模板。這證明「某些大型已知複合體可以被準確預測」,不能直接外推成萬級輸入已能穩定泛化。
研究團隊接著把輸入推到 31,140~70,320 個殘基。七次運算都在一台含八張 B300 的節點上完成,但七個預測全部塌成緊密、彼此穿透的結構;有計分的三個 TM-score 只有 0.14、0.08、0.08。只有四次使用單一 trunk pass、不做 recycling;AAV2 使用 10 次 recycling 與晶體模板,仍然失敗。
“Big mode extends what can be computed, not what the models have learned.”
中文:Big 擴張的是能算到哪裡,不是模型已經學會了什麼。
Anthropic 技術報告

蛋白質 binder:成本下降了,證據還停在電腦裡
Anthropic 也讓 Opus 5、Mythos 5.1 與 Mythos 5 對 16 個 targets 做 binder 設計。每個單模型 run 使用一張 H200、24 小時,沒有網路、sub-agent 或人工 steering;報告以 ipSAE 這個 in silico 分數比較設計品質。Opus 5 與 Mythos 5.1 的 median ipSAE 超過較早 campaign,但這仍是電腦評分,不是結合實驗。
報告所稱約 100 倍 GPU-hour 差距,是 24 H200 GPU hours 對比早期單一標的 campaign「最多可用」約 2,500 H100 GPU hours;兩邊 GPU 不同,後者也是預算上限而非完整公布的實際消耗。有無加速的流程還同時更換 reference sheet 與程式版本,無法把全部差異只歸因於優化模型。更關鍵的是,報告明載這批新設計尚未做實驗測試。
這也是閱讀先前 Claude 設計蛋白質 binder 時最重要的分界:ipSAE 是值得追蹤的訊號,wet lab 才是把預測推進成生物知識的關卡。
公開程式碼的價值,和完整重現是兩件事
Anthropic 已公開 36 套 optimization kits。每套大致提供釘選的 upstream 版本、STOCK/CHANGES 說明、安裝與檢查路徑,讓有相符 NVIDIA GPU、driver 與模型權重的團隊自行比較 off、exact、fast 或 big。這比只發布新聞稿前進很多。
但截至 2026 年 9 月 20 日,公開 artifact 的主要可重跑單位是個別 kit,不是一個能逐筆重建整篇報告的研究套件。技術報告的 Data and code availability 指向程式碼 repo,而速度、記憶體圖、1,925 組介面資料、190 次大型結構 run 與新版 binder campaign 的完整原始紀錄並未被組成同一套公開 benchmark harness。最合理的讀法,是把 headline 數字視為 Anthropic 在指定硬體、版本與計時邊界下的自報結果,再等待使用者於自己的 workload 重跑。
真正的進展,是 AI 開始替科學工具修路
這次 Claude 生物分子模型加速最有價值的地方,不是 Claude 突然懂得更多生物學,而是它能跨數十個陌生 codebase,把 kernel、快取、排程與記憶體策略整理成可交付的工程成果。這與 Claude AI R&D 自動化指數指向同一件事:AI 對研發的早期影響,可能先出現在研究基礎設施,而不是直接取代科學判斷。
對研究團隊而言,穩健的採用順序很務實:
- 先用 Exact 建立自己的可重現 baseline,確認真正啟用優化,而不是靜默回到 stock。
- 再讓 Fast 通過自己的任務指標,記錄完整 wall time、記憶體、失敗樣本與品質,而非只抄 forward-call 平均。
- 最後才用 Big 探索原本放不進記憶體的系統,並把「運算完成」與「預測正確」分開驗證。
如果這些步驟能被不同團隊、不同硬體與真實資料重複,這 36 套工具的意義就不只是漂亮的加速數字,而是 AI 協助科學軟體工程的一個可累積起點。下一次看到「更快、更大、更便宜」的 AI 科研成果,先問三件事:量的是哪一段流程、成功樣本怎麼挑,以及證據有沒有跨出電腦、進入真實世界。
接著閱讀
左右滑動查看更多推薦
