跳到主要內容

Claude 發現 ART:950 個 AI Agent 找到什麼、還沒證明什麼?(2026)

最後更新: ·
Claude 發現 ART:AI Agent 找到功能未知的酵素系統

2026 年 9 月 23 日,Anthropic 在官網發布〈Claude discovers a novel enzyme system with CRISPR-like repeats〉,公開一項「Claude 發現 ART」的早期研究:AI Agent 從龐大基因體資料中找出一組異常的逆轉錄酶、重複序列與夥伴蛋白,人類科學家再把候選帶進實驗室。真正值得注意的,不是 AI 已經做出新版 CRISPR,而是它第一次把一條原本不在任務裡的異常線索推進成可被實驗追問的研究對象。

Anthropic Claude 發現 ART 原文頁面截圖
Anthropic 於 2026 年 9 月 23 日發布的原文;點圖可開啟完整文章。圖/Anthropic

這篇文章會先還原 ART 到底是什麼,再把「950 個 Agent、2.1 億 token、21 小時」放回技術報告的精確口徑,最後逐層分開已觀察到的結構、已完成的 RNA 實驗,以及仍未知的生物功能。

Claude 發現 ART,到底發現了什麼?

ART 是 array-associated reverse transcriptase 的縮寫,可譯為「陣列相關逆轉錄酶」。它不是單獨一顆突然出現的新蛋白,而是一組反覆一起出現的基因體架構:

  1. 一段由多個單元組成的非編碼 DNA 重複陣列;
  2. 一個逆轉錄酶(RT)基因;
  3. 一個緊鄰 RT 的夥伴蛋白基因。

關鍵的新意是「這三者形成一個穩定家族」,而不是 RT 本身從未被看過。早在 2021 年,MarsHill 等巨型噬菌體的基因體研究就已標註這類 RT;新的技術報告則指出,先前研究沒有把上游陣列、RT 與下游夥伴辨認成同一套系統。這也是為什麼 原始 MarsHill 論文與今天的「Claude 發現 ART」並不矛盾:蛋白早已在資料庫裡,系統層級的關聯才是新主張。

“Although we don’t yet know its function, the system that Claude discovered has a set of characteristics…”

中文:雖然我們還不知道它的功能,但 Claude 找到的系統具有一組值得繼續追查的特徵。

Anthropic 原文

「CRISPR-like」指的是排列邏輯,不是基因編輯能力

ART 與 CRISPR 最直觀的相似處,是「重複序列與間隔序列交替排列」。但技術報告量到的差異同樣重要:ART 的重複序列約 15~49 個核苷酸,間隔約 120~220 個核苷酸;已分析的陣列有 3~21 個重複單元,而且相關噬菌體之間常保留相同順序。CRISPR 的 spacer 通常短得多,且會隨免疫記憶新增或遺失。在報告分析的 ART 位點周邊,作者也沒有找到 cas 基因。

問題ART 目前的證據不能因此推論
外觀像不像 CRISPR array?有重複序列與不同 spacer 交替不等於具有 CRISPR-Cas 機制
陣列會不會被轉錄?會形成多種短 RNA不等於這些 RNA 能導引切割或編輯
是否可能可程式化?架構提出了值得測試的假說功能未知;可程式化仍是待測假說
Claude Agent 從 DNA 序列辨認 ART 重複陣列的技術報告圖
技術報告 Figure 1 的關鍵區段:Agent 先追查 RT 上游非編碼區,再從原始 DNA 文字中辨認出 14 次重複。圖/Anthropic 技術報告

950 個 Agent 在 21 小時裡做了什麼?

官網把數字寫成約 950 個 Agent、2.1 億 token、21 小時;技術報告提供更精確的執行紀錄:949 個 Claude Code session、215.6 million tokens、21.5 小時牆鐘時間,合計 77 agent-hours,最高同時運行 58 個 session。

階段技術報告的精確數字它代表什麼
搜尋空間1.94 billion protein clusters不是把所有序列一次塞進模型,而是由 Agent 寫程式、呼叫資料庫與逐步縮小範圍
RT 集合198,290 個 RT clusters建立家族與鄰近基因的搜尋基礎
候選夥伴3,564 個 protein families、10,983 個 loci用 Agent 自訂條件排序值得深入的關聯
深挖結果17 個候選家族、19 份報告官網的「3,500 與 20」是四捨五入後的敘述
任務網119 個 tasks,其中 98 個由 Agent 延伸ART 正是從原任務之外的 follow-up 長出來

這套 harness 把角色拆成 worker、supervisor、curator 與 editor。Worker 寫計畫與執行分析,supervisor 審查並開 follow-up,curator 更新共享知識庫,editor 整理最後報告。作者稱這 21.5 小時的計算 campaign 內沒有人工介入;但研究目標、初始 brief、harness 設計、最終人類審查與所有濕實驗仍由 Anthropic 科學家負責。換句話說,「自主」描述的是受限工作流中的搜尋段,不是整個科學過程沒有人。

最有價值的不是一次答對,而是會追殺自己的錯誤假說

ART 並不是由一條完美直線找出來的。Agent 一開始把鄰近的噬菌體 RNA polymerase subunit 當成可能的 retron 夥伴,後來自己否決這個解釋;supervisor 沒有就此結案,而是開出追查 RT 上游非編碼區的新任務。Worker 把那段 DNA 直接讀進 context,才注意到 16 個核苷酸左右的核心重複。

這種「先錯、再反駁、再沿旁支追下去」比一次分類命中更接近研究。不過它也暴露了限制:作者用同一 campaign 重跑 10 次,沒有一次重新讀取 RT 上游 DNA 並找回 ART。這不是穩定的自動化流水線,而是具備大規模試錯能力、偶爾捕捉到高價值異常的搜尋系統。

人類實驗究竟驗證了什麼?

「Claude 發現 ART」真正跨過純文字推測的地方有兩層。第一層是家族一致性:團隊後續找到 95 個不同的 RT cluster,其中 28 個能在 RT 上游偵測到重複陣列;這些成員還帶有共同的長 N 端特徵與三類專屬夥伴蛋白。第二層是 RNA 證據:陣列不是沉默的 DNA 裝飾,而會產生可觀察的短 RNA。

團隊先重新分析 2022 年公開的 SA1 噬菌體感染 RNA-seq。技術報告取用其中感染後 5、15、55 分鐘的 3 組培養重複;原研究也把 raw reads 公開在 BioProject PRJNA836150。Anthropic 的重新分析顯示,感染 15 分鐘時,ART 陣列衍生 RNA 最高可占噬菌體 RNA 的 8%,並呈現可重複的短片段邊界。

為避免只依賴舊資料,團隊又把 SA1 ART 系統放進大腸桿菌,以 native locus 與 heterologous promoter 兩種構型做 small-RNA sequencing;兩種構型都觀察到離散短 RNA。這證明陣列會被處理成多個 RNA 單元,但還沒有把它們的生物任務說清楚。

ART 重複陣列在噬菌體感染與大腸桿菌實驗中的 RNA 證據
技術報告 Figure 3 的證據鏈:公開 SA1 感染 RNA-seq、團隊在大腸桿菌中的 small-RNA 實驗,以及候選 RNA 結構。圖/Anthropic 技術報告

“Beyond these observations, we have not shown that the RT is active or that the unit RNAs are its substrates.”

中文:除了上述觀察,研究尚未證明 RT 具有活性,也未證明這些單元 RNA 就是它的受質。

Anthropic 技術報告 Discussion

目前仍卡在功能斷點

  • RT 是否真的工作:催化 motif 保留,不等於已觀察到逆轉錄產物。
  • 短 RNA 是否是 RT 受質:表達與 RNA 結構已看見,但因果關係仍待實驗。
  • 夥伴蛋白做什麼:共現與結構預測支持它值得研究,實際互動與功能仍未知。
  • 整套系統替噬菌體完成什麼:論文提出可能辨認不同 trigger 的假說;phenotype、targeting 與可程式化能力都需要後續實驗判定。

這算「AI 做出科學發現」嗎?

答案取決於你把「發現」放在哪一層。若它指的是從原始序列辨認新架構、形成可檢驗假說,再被人類實驗確認其中一項現象,ART 是一個扎實案例。若它指的是解開完整機制、證明用途或交付新基因編輯工具,證據還遠遠不夠。

1. 它超越了摘要,但沒有越過實驗

Claude 並不是把幾篇論文重寫成一個「新點子」。它寫程式、建 HMM、搜尋資料庫、查看 genomic neighborhood,最後直接讀到一段 DNA 並辨認重複模式。這比文獻整理多了一步真正的 primary-data observation。可是一旦問題變成「RT 會製造什麼、夥伴蛋白如何作用、對噬菌體有何好處」,答案仍需要人類設計與執行實驗。

這與 Gemini Co-Scientist 從假設走進實驗、以及 AI 設計完整噬菌體基因組的案例放在一起看,會得到同一條分界:模型可以加速候選生成與排序,但生物學價值要由可重複的 phenotype 與機制證據決定。

2. 十次重跑都沒找回 ART,是限制也是線索

0/10 的重跑結果會讓「自主發現」聽起來沒那麼乾淨,但它提供了一個重要設計訊號:Agent 沒有失敗在看不懂 DNA,而是常常根本沒有把那段 DNA 讀進 context。作者另做固定輸入 benchmark 後發現,直接把 locus 放進 context 時,較強模型辨認陣列的比例至少達 90%;改成檔案與工具後,部分設定低到 32%。在檔案模式中,39% 嘗試沒有連續讀取至少 200 個核苷酸。

這和一般直覺相反:工具愈多,不一定看得愈深。若 Agent 只操作檔案名稱、統計摘要與搜尋結果,primary data 反而可能被抽象層遮住。對研究型 Agent 而言,最重要的 harness 設計之一不是再加工具,而是確保模型真的看見足夠長的原始資料,並把「看過什麼」寫進可稽核 trace。這也呼應 Claude Code 研究工作流的 Ownership Budget:真正的研究所有權來自可追溯的觀察與判斷,不是工具呼叫數量。

3. 2.156 億 token 是搜尋規模,不是科學價值

token 數告訴我們這次搜尋動員了多大的語言模型計算量,卻不能直接回答效率。下一個真正有判別力的比較,應該在同一資料、時間與計算預算下,讓專家搭配成熟基因體探勘 pipeline、一般自動化流程與 Agent harness 正面比較:誰找到更多真正的新系統、假陽性多少、每個可驗證候選成本多少。沒有這個比較,ART 證明的是「Agent 可以找到一個高價值異常」,還不是「這是最有效率的發現方法」。

我同意什麼、我存疑什麼

我同意:Claude 發現 ART 是目前少見、trace 相對完整的 AI 科學案例。它把一次偶然 observation 留下原始推理紀錄,技術報告也沒有隱藏 10 次重跑失敗,並用公開資料與新實驗把「有趣模式」推到「真實存在且會產生 RNA 的系統」。這比只展示漂亮答案可信得多。

我存疑:原文把 CRISPR 的歷史放在開場,容易讓讀者把「架構相似」提前腦補成「功能與應用相似」。目前最強的結論是:ART 是值得追查的新 RT 家族,陣列會產生多種短 RNA;最吸睛的可程式化、切割、複製或貼上 DNA 仍只是由相似系統推導出的研究方向。論文作者、使用的模型與實驗室也都屬於 Anthropic;這不會自動否定數據,卻讓獨立重現與同行審查更重要。

同樣的證據紀律也適用於其他 AI 生物研究。讀 Claude 蛋白質設計實驗時,要分開「模型生成」「實驗命中」與「臨床價值」;讀 AlphaGenome Atlas時,也要分開「變異預測」與「臨床答案」。ART 最有價值的地方,正是讓這條證據梯子變得清楚。

接下來看哪四個驗證點?

  1. RT 活性:是否能直接觀察到由 ART RT 製造的 DNA 產物?
  2. RNA 受質:不同 array unit 是否被 RT 使用,產物是否隨 unit 改變?
  3. 夥伴與 phenotype:移除 RT、array 或 partner 後,噬菌體感染或競爭表型如何變化?
  4. 外部重現:獨立實驗室能否在其他 ART 家族重現 RNA、DNA 產物與功能?

在這四關通過前,最準確的說法不是「AI 發明了新 CRISPR」,而是「AI 從原始基因體資料中找出一套新 RT 架構,人類已證實其陣列會產生短 RNA,功能仍待破解」。這個版本少一點神話,卻更能看見真正的進步:Agent 開始成為科學觀察力的放大器,而不是實驗證據的替代品。

接著閱讀

左右滑動查看更多推薦

下一次看到「AI 發現了 X」,先把結論拆成資料中的異常、可重現的實驗現象、已知機制與實際用途四層;只要有一層仍空白,就把它當成下一個要追的實驗,而不是已兌現的突破。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。