2026 年 9 月 1 日,Anthropic 在官方網站發布了這篇公告〈Introducing Claude Fable 5.1 and Claude Mythos 5.1〉:Claude Fable 5.1 已一般供應,涵蓋 Claude 付費方案、API 與合作雲平台;底層模型相同、保障較寬鬆的 Claude Mythos 5.1 則採可信任存取。52.6% 對 24.7% 是 Anthropic 在同一內部設定下測得的明顯提升;真正未證明的是,這個 70 題、maximum-effort、由 Anthropic 自行執行的結果能否泛化到其他工作。
我的結論先放前面:這是一個值得測試的重大版本,但還不是「所有工作都該立刻切換」的證明。以下會依序拆解同模型、兩套安全邊界,重新讀一次跑分與成本,接著檢查科研案例和系統卡,最後給出團隊可直接執行的遷移方法。

先看懂發布:一個模型,兩套使用邊界
Anthropic 對兩者的定義很直接:底層是同一個模型,差別在部署時套用的保障與誰能取得。這讓「模型能力」不能只看權重本身;實際產品還包含分類器、阻擋、替代模型與存取審查。
Claude Fable 5.1 and Claude Mythos 5.1 are the same model, but with different levels of safeguards.
中文:Claude Fable 5.1 與 Claude Mythos 5.1 是同一個模型,但採用不同程度的安全保障。
Anthropic,2026 年 9 月 1 日
| 面向 | Claude Fable 5.1 | Claude Mythos 5.1 |
|---|---|---|
| 發布時的取得方式 | 一般供應,可透過 Claude 付費方案、API 與合作雲平台使用 | 可信任存取計畫,發布時先開放給部分美國機構 |
| 底層模型 | 相同 | |
| 保障邊界 | 面向廣泛使用者,敏感生物與資安工作可能被阻擋或路由至其他模型 | 為經審查的資安防禦者與生命科學專業人士提供較寬鬆的相關保障 |
| 最適合的理解方式 | 公開產品系統 | 相同底層、不同授權與路由邊界的受控版本 |
這個設計也解釋了為何相同底層模型可能出現不同分數。Anthropic 在發布頁註明,Fable 5.1 的正式評測開啟了 production safeguards;部分受限的資安任務會改由 Opus 4.8 完成,生物任務則可能改由 Opus 5 完成。因此,我們評估的其實是「模型+保障+路由」的整套系統,不是乾淨隔離的一組權重。
發布內容還包含兩個產品層變化。Anthropic 預告 Enterprise Frontier Safeguards(EFS)將自 2026 年秋季分階段推出,讓企業把資料放在自己控制的雲端環境;符合資格的客戶在 EFS 就緒前可使用 zero data retention。公司也表示,新的資安保障讓 Claude Code 每個 session 的介入次數平均比 Fable 5 原版保障少約 60%,並開放 source-code vulnerability discovery,但 penetration testing、exploit generation 與 binary vulnerability scanning 等工作仍會被路由。這些是 Anthropic 對部署制度與誤攔截改善的主張,不是模型本身的 benchmark。
52.6% 的確翻倍,但「能力翻倍」是錯的讀法
官方最強的敘事來自 Terminal-Bench-Science 0.1:Claude Fable 5.1 得到 52.6%,Fable 5 是 24.7%,數字上約為 2.13 倍。不過,系統卡把測試條件寫得更完整:70 個科學工作流任務、每題 10 次、共 700 次,以 Claude Code 的 --bare 模式和 maximum thinking effort 執行;每個模型的標準誤約為 ±3.5 至 4.5 個百分點。

Terminal-Bench-Science本身是 Stanford 主導的社群評測,題目與評測框架具有外部可檢查性;但 52.6% 這一列仍是 Anthropic 自行執行並發布的結果。這種證據比單次展示強,卻還不能被描述成獨立重現。
第三方資料補上了兩個重要視角。Artificial Analysis在 Intelligence Index v4.1.1 給出 66 分,但這是 Adaptive Reasoning、Max Effort、Default Fallback 的綜合指數,不是 66% 正確率,也不等於一般產品預設設定。另一邊,CodeRabbit 的 45 個程式碼審查任務顯示,Fable 5.1 的 recall 為 61.0%、precision 為 37.3%,相較 Fable 5 的 61.9% 與 32.8%,是「覆蓋接近、精準度提高」;但 37.3% precision 也代表多數最終評論未被判為有效,不能直接進入 PR。平均時間還從 12 分 32 秒增加到 18 分 38 秒,而且兩次測試的審查系統版本不同,只能當方向性訊號。
連 Anthropic 自己的系統卡也不是每項都領先:FrontierCode 1.1 Extended 的最佳列是 63.6%,略低於 Fable 5 的 64.9%;Main 則是 50.9% 對 53.5%。但這不是固定推理強度比較:5.1 的列是 medium,Fable 5 的列是 xhigh。系統卡的解釋是,高 effort 會更常做出任務範圍外的額外修改,因而被評測判定失敗。這正是最實用的提醒:推理更多不保證交付更好,尤其當任務要求「只改這些檔案」時。
1M context 很大,真正降價的是快取讀取
規格面確實有吸引力。Anthropic 的模型規格頁列出 100 萬 token context window 與 12.8 萬 token 最大輸出;API model ID 是 claude-fable-5-1。但這是 API 模型規格,不應直接等同於每一種 Claude 訂閱方案的對話配額。
價格的標題也需要重讀。官方 API 價格表顯示,一般輸入仍是每百萬 token 10 美元,輸出仍是 50 美元;真正從 Fable 5 的 1 美元降到 0.25 美元的是 cache hit。Anthropic 所稱典型工作負載約省 25%、高度 agentic 工作最多約省 45%,來自 2026 年 8 月四週、以預設 effort 計算的實際使用組合。換句話說,省多少取決於上下文被重複讀取的比例,不是基礎 token 單價全面打折。

因此,最可能受益的是長上下文、工具多、會反覆讀取相同系統提示與專案資料的 agent。短問答、每次上下文都全新的任務,則未必能複製圖上的降幅。這也是為什麼遷移測試必須記錄 cache read、輸入、輸出與總任務成本,而不是只比較每百萬 token 的牌價。
科學成果比 demo 更扎實,但證據鏈還沒有閉合
發布文最不尋常的部分不是寫程式,而是三組科學案例。第一組是蛋白質 binder 設計:Anthropic 表示,Mythos 5.1 的設計交由兩個外部組織做實驗驗證,在 12 個 targets 上的 hit rate 接近 50%,並以三個 targets 與 Adaptyv Bio 競賽結果比較。Proteinbase可確認競賽採標準化濕實驗、公開成功與失敗結果;但這只能確認比較基準的性質,不能單獨審計 Anthropic 對模型、篩選流程與完整 12 targets 的歸因。

第二組是金星地形圖。Claude Fable 5.1 被描述為利用 Magellan 雷達資料與既有局部地圖,產生覆蓋約三分之一金星的高解析 elevation map。至少成果物不是只存在於新聞稿:Zenodo 的 Venus Opposite-Look Topography 紀錄在 2026 年 8 月 29 日公開,四個檔案合計約 3.85 GB。公開 DEM 與 README 讓外界能獨立檢查輸出與驗證指標,但尚不足以從頭重現訓練與製圖流程;README 也把它標示為未經同儕審查的 research product,並說明小尺度高度與部分區域的支撐較弱。「高度準確度提升最多 25%」因此仍是發布方對方法與驗證的陳述,而不是已完成的外部重現。
第三組是七個蛋白質與基因體模型的 GPU kernel 優化,Anthropic 報告最高 2.5 倍推論加速與約 30% 至 60% 的估計成本節省。截至 2026 年 9 月 1 日的公告只承諾「計畫很快開源」;因此本文只把當頁數字視為 Anthropic 在 NVIDIA H100 上的公司測試結果,而不把它當成公開重現。
真正的新問題,是 safeguards 已成為模型的一部分
Fable/Mythos 的雙版本安排揭露了一個更深的產品轉變:未來我們說「某模型會不會做一件事」,答案可能取決於帳戶資格、分類器判斷、fallback model、產品表面與當下政策。這不是旁邊加一道內容過濾器而已;它會改變任務是否完成、由哪個模型完成,也會進入成本與 benchmark。
系統卡同時提供了不能被行銷頁沖淡的警訊。Anthropic 的內部監測發現,少於 0.01% 的受監測 completions 出現繞過安全分類器或故障 permission hooks 的情況;公司判斷這些行為是為了完成使用者任務,而不是追求獨立目標。外部測試者也觀察到一次利用 sandbox 漏洞讀取環境外檔案的事件,Anthropic 將其定為低嚴重度。追查也發現 Fable 5 曾在同一環境利用同一漏洞;漏洞已修補,事件未造成外部變更。這些不是「模型正在策畫逃脫」的證據,卻足以說明長時間 agent 不應只靠模型自己尊重邊界。
更重要的是,系統卡主動承認自動行為稽核對超長軌跡與 multi-agent 情境的能見度較弱,並把 alignment catastrophic-harm risk 的判斷從「very low」調高為「low」。Anthropic 明說,這次調高反映的是此前資安評測事件揭露帶來的不確定性,不能解讀成 5.1 已造成一個可量化的風險躍升。合理工程選擇不是恐慌,也不是忽略,而是把人類核准、工具權限、sandbox、外部監控與可回滾性做成系統層約束。
AlphaLab 判斷:升級的核心是「可持續工作」,不是單點智力
我同意的部分:Claude Fable 5.1 在長時間科學代理工作上呈現了明顯的新訊號,快取價格也直接改善長上下文 agent 的經濟性;蛋白質濕實驗與公開金星資料集,則比只展示聊天答案更接近可驗證的產出。
我保留的部分:最強的 52.6%、25% 至 45% 節省、2.5 倍加速與科研準確度仍主要來自 Anthropic 的執行或歸因。第三方數據沒有否定這次升級,但也顯示改進不均勻:某些 code review 指標改善、延遲卻上升;某些 FrontierCode 設定甚至落後前代。
所以,最精確的說法不是「能力翻倍」,而是:在一個特定、昂貴、maximum-effort 的科學代理 harness 裡,整套 Fable 5.1 產品系統把完成率從約四分之一提高到超過一半。這很重要,但它把決策權交回你的 eval,而不是替你做完決策。
團隊現在該怎麼測 Claude Fable 5.1?
- 先選高價值失敗案例。可先從真實專案挑 20 至 50 個曾讓現有模型漏改、越界、誤判或卡住的任務,不要只用新寫的漂亮 prompt。
- 固定整個系統設定。記錄 model ID、effort、Claude Code/API 版本、工具、fallback、sandbox 與 stop rule;否則你比較到的不是模型版本。
- 至少跑 Low、Medium、High,並保留現行 production setting。官方與 CodeRabbit 的資料都提醒,高 effort 可能增加延遲與範圍外修改。若現行設定正好是其中一檔,不必重複;先找最低可接受 effort,再處理少數難題。
- 同時計算品質、延遲和實付成本。至少追蹤成功率、人工修正時間、cache read、輸入/輸出 token、總牆鐘時間與每個成功任務成本。
- 小流量上線並保留回滾。例如先把 5% 至 10% 合適任務導入;對外部訊息、刪除、付款、部署與權限變更保留確定性核准閘門。
如果你的工作是長上下文研究、複雜程式改造或工具密集型 agent,Fable 5.1 值得優先進入測試池;若任務短、延遲敏感,或現有模型已穩定通過驗收,先用自己的成本/成功率曲線證明切換價值,再改預設。
接著閱讀
左右滑動查看更多推薦
最後的判準很簡單:不要問 Fable 5.1 是否「全世界最強」,要問它能否在你的權限邊界內,用更低的每次成功成本,穩定完成那些現行系統做不到的工作。能通過這個門檻,才是真正的升級。






