跳到主要內容

Claude 主導 AI 研發 26%?Anthropic 內部指數真正量到什麼(2026)

最後更新: ·
Claude 主導 AI 研發 26%,Anthropic 內部自動化指數分析

Claude 主導 AI 研發,是 Anthropic 在 2026 年 9 月 17 日公布的新說法:依其原型「AI 研發自動化指數」,Claude 在 8 月對 26% 被量測的工作達到 AL4,也就是研究人員只給高階提示、AI 執行大部分任務,但仍由人類監督。這個數字值得重視,卻不能直接翻成「Claude 完成了 26% 的研發成果」。

Anthropic 衡量 Claude 主導 AI 研發進展的官方文章頁面
Anthropic 公布 AI 研發自動化、Agent 監督與安全算力三組內部量測;畫面取自官方原文

真正重要的新聞,不只是 26% 變大了,而是 Anthropic 開始嘗試把「AI 幫忙打造下一代 AI」變成可追蹤的內部營運儀表板。公司同時揭露:超過 90% 的被量測工作達到 AL3「協作」以上、主要內部平台同時約有 30,000 個 Agent 運行,以及 Agent 行為如何被線上與離線監控。

問題也正在這裡:指標由 Anthropic 定義,資料來自 Anthropic,工作內容由 Claude 蒐集,等級也由另一個 Claude 判定。這不是造假的證據,卻代表讀者要把它視為一套有用的內部領先指標,而不是已由外部重算的生產力結論。

Claude 主導 AI 研發 26%,到底量到什麼?

Claude “leads” 26% of Anthropic’s AI R&D work.

中文:Claude 在 Anthropic 的 AI 研發工作中「主導」26%。

Anthropic

這裡的「主導」有很窄的技術定義。Anthropic 採用 Epoch AI 提出的 Automation Level,把工作分成 AL0 到 AL5。報告最需要分清楚的是三個高階層級:

等級人與 AI 的關係不能誤讀成什麼
AL3:協作AI 能處理大段工作,但人類仍密切指揮不是 AI 獨立完成
AL4:主導人類給高階提示,AI 完成大部分流程,人類監督不是不需審查,也不是成果占比
AL5:自主AI 在沒有 human-in-the-loop 的情況下運作Anthropic 的這批量測沒有任何工作落在此級

因此,26% 是被分類為 AL4 的工作種類之人力時間加權占比。它不是程式碼行數、研究突破數、論文數,也不是公司總產出的 26%。同理,「超過 90% 達 AL3 以上」表示 AI 已經滲入大多數工作類型,不表示 AI 做完九成工作。

Anthropic 內部指數顯示 Claude 主導 AI 研發工作的比例升至 26%
Anthropic 的原始圖表顯示,AL4「AI 主導」占比從 2026 年 2 月低於 1% 升至 8 月 26%;這是內部原型指數,不是外部生產力審計。圖片來源:Anthropic

這個指數是怎麼做出來的?

Anthropic 的方法可以拆成四步。先在 2026 年 7 月每週抽取相關部門約 20% 員工;再讓 Claude 讀取 Slack 與內部文件,整理約 15,000 個細項任務;接著建成含 542 個節點、378 個葉節點的工作樹;最後由另一個 Claude judge 依證據替每個節點評定 AL0 至 AL5。

  1. 先固定工作籃子:以 2026 年 7 月的人類工作內容為基準,避免每個月換定義。
  2. 再估自動化程度:評分 Agent 只能看到當月或更早的證據,降低未來資訊滲入。
  3. 用人力時間加權:每位員工每週有一單位權重,再平均分配給其處理的任務。
  4. 用人類評分校準:工作領域負責人在不知道模型證據與判斷的情況下,另外給出等級。

校準結果很值得細看:模型與人類的完全一致率是 59%,人類彼此完全一致率是 35%,模型與人類落在相差一級以內的比例是 97%。59% 代表分類一致程度,不代表 59%「準確率」;而人類彼此只有 35% 完全一致,也說明 AL3 與 AL4 的邊界本來就帶有判斷空間。

這套方法的一個優點,是把抽象的「AI 進步很快」拆成可重複觀察的分類。它的一項限制,則是 Claude 同時參與資料整理與等級判定,加上固定工作籃子可能漏掉後來出現的新工作。Anthropic 有做另一組「新任務」比較,也計畫定期重建工作籃子;目前公開內容提供方法與摘要,原文則把獨立第三方驗證列為後續方向。

30,000 個 Agent,代表的是規模,不是 30,000 名研究員

Anthropic 表示,截至 2026 年 8 月,在其最常用的內部平台上,同一時間約有 30,000 個 Agent 執行研究與工程工作。這個數字只涵蓋該平台,也不能直接換算成人類職位、完整專案或有效產出。它反映的是該平台中 Agent 的同時運行規模;若要做人力等值比較,還需要活躍與等待狀態、任務長度及成功率等資訊。

真正值得注意的是監督負荷。依 Anthropic 的內部統計,該平台的動作都會經過線上監控並被離線監控收錄;8 月超過 10 億次決策中,約 0.002% 被線上監控阻擋,相當於約每 47,000 次一次。離線系統每週標記約 100,000 份 transcript,經多層分類器篩選後,最高優先級約 50 份交由人類審查。

低阻擋率本身既不是安全證明,也不是危險證明。它可能代表大多數行為正常、前置限制有效,也可能受監控器漏判率與任務分布影響。要判斷 30,000 個 Agent 是否可控,外界還需要看到監控覆蓋的例外、誤判與漏判測試,以及問題被發現後的修復時間。

Claude 主導 AI 研發,為何不等於整體加速?

最容易犯的錯,是把「工作中有 AI」直接換算成「研發速度提高同樣比例」。METR 在 2025 年的隨機對照研究,讓 16 名開發者在其平均已有 5 年經驗的成熟開源專案中完成 246 項任務;每項任務隨機分配為可用或不可用 AI。以 2025 年 2 至 6 月的工具條件為準,允許使用 AI 的任務平均多花 19% 時間,儘管參與者事前與事後都估計 AI 會讓自己變快。這是較早期系統與特定開源場景,不能直接反駁 Anthropic 2026 年 8 月的內部結果,卻清楚證明「採用率」和「淨生產力」是兩種不同指標。

到了 2026 年,METR 表示原本的實驗設計已難以維持。愈來愈多開發者因不願在一半任務中禁用 AI 而不參加;30% 至 50% 受訪者也承認,會避開預期 AI 增益較高、卻可能被分到禁用 AI 組的任務。多個 Agent 並行及等待期間處理其他工作,也讓工時難以可靠計量。METR 因而認為,新資料很可能低估真正的 AI 增益;其後續方法更新顯示,2026 年初的加速可能高於 2025 年初,但資料對「改善幅度」只提供非常弱的證據,不能外推成整間實驗室的加速倍數。

Anthropic 自己在 2026 年 8 月風險報告中的語氣也更保守。以 2026 年 7 月 15 日為資料涵蓋日,公司判斷其模型似乎還沒有接近以具競爭力成本取代整體研究科學家與研究工程師團隊;雖然 AI 研發輔助已帶來顯著加速,但 Anthropic 認為,仍不足以讓整體 AI 進展速度相較 AI 輔助前翻倍。報告也承認,前一判斷並未用「花費研究員完整成本五倍」的直接替代實驗驗證,而後一判斷仍有不確定性,且可能落後於最新變化。這與 26% 並不矛盾——一個 Agent 可以主導某些被切好的任務,但選題、跨任務整合與判斷失敗,仍可能是整條研發鏈的瓶頸。

判斷:重要的是「可驗證的閉環」

Claude is not operating fully autonomously for any measured subset of AI R&D work.

中文:在任何被量測的 AI 研發工作子集中,Claude 都尚未完全自主運作。

Anthropic

「AI 會加速 AI」只有在一個閉環成立時,才會從工具進步變成研發速度的結構性改變:AI 提出方案、執行實驗、辨認失敗、整合結果,再把有效知識送回下一輪,而且每一步的錯誤都能在成本可控時被發現。26% 顯示部分既有任務已可由 Claude 從高階提示推進到接近完成;它本身不證明跨任務、跨模型世代的自我改進閉環已成立。沒有 AL5,則表示依這套量尺,所有被量測工作仍有人類留在迴路中。

因此,這份報告最有價值的不是宣告「自我改進已經到來」,而是提出一個可被追問的衡量框架。《Measuring AI R&D Automation》建議同時追蹤研究者時間、AI 與人類/人機團隊的績效實驗、監督紅隊、AI 顛覆事件、權限與算力分布等指標。Anthropic 公布的自動化、監督與安全算力資料覆蓋了部分相鄰面向,但定義並非一一對應,也不是這套框架的完整實作。

接下來真正該盯的四件事

  1. 同一指標能否持續更新:若 AL4 比例繼續上升,同時公開工作籃子改版,才能分辨真進展與定義漂移。
  2. 有沒有結果型指標:除了 AI 參與程度,還要看完成時間、返工率、實驗成功率與可重現成果。
  3. 監督是否跟得上規模:Agent 數增加時,人類升級案件、漏判測試與修復時間不能惡化。
  4. 第三方能否比較:其他實驗室若用相同層級、公開方法與外部查核,26% 才會從公司內部儀表板變成產業共同語言。

我的結論是:Claude 主導 AI 研發 26% 是一個值得重視、但仍待外部重算的內部營運訊號,不是 26% 的成果已由 AI 獨立交付。它最可能預告的未來,不是研究員突然消失,而是研究工作的單位從「一個人操作一個工具」變成「一個人設計、調度與審查許多並行 Agent」。哪家公司能把速度、判斷與監督一起做成可驗證閉環,才真正掌握下一輪優勢。

接著閱讀

左右滑動查看更多推薦

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。