Claude Opus 5 深度解讀:半價逼近 Fable 5,真正躍進是「驗證到成功」(2026)

最後更新: ·
Claude Opus 5 深度解讀封面:執行、驗證與修正的代理迴圈

2026 年 7 月 24 日,Anthropic 在官網發布了〈Introducing Claude Opus 5〉,正式推出 Claude Opus 5。它的定位很精準:不是全面取代 Fable 5 作為 Anthropic 一般用途/frontier intelligence 的能力上限,而是用 Opus 4.8 的價格,提供逼近 Fable 5 的能力與更完整的代理工作流。

Anthropic Introducing Claude Opus 5 官方發布頁面
點圖可閱讀 Anthropic 原文。Anthropic 於 2026 年 7 月 24 日發布 Claude Opus 5。圖/Anthropic

這篇文章會依序做三件事:

  1. 先忠實整理 Anthropic 想用 Claude Opus 5 解決什麼問題;
  2. 再把 Frontier-Bench、CursorBench、ARC-AGI 3、AutomationBench 與 System Card 逐一對帳;
  3. 最後判斷它真正改變了什麼,以及哪些 headline 仍不能照單全收。

Claude Opus 5 的核心主張:把前沿能力做成日常模型

Anthropic 的產品切法不是「再做一個最高分模型」,而是把能力、價格與可部署性重新配對。標準 Claude API 的未快取 input/output 基礎價為每百萬 token US$5/US$25,與 Opus 4.8 相同;相較 Fable 5 的標準價則是半價。模型支援 100 萬 token context、同步 Messages API 最多 12.8 萬 output token,以及 low、medium、high、xhigh、max 五級 effort。

項目Claude Opus 5真正要注意的限定
標準 API 價格Input US$5/MTok;output US$25/MTok不含 cache、Batch、server tools、區域與雲端平台差異
產品定位Claude Max 新預設;Claude Pro 可用模型中最強Pro 訂閱不含 API 用量;Fable 5 仍是 Anthropic 一般用途/frontier intelligence 能力上限更高的公開模型
Effortlow、medium、high、xhigh、max這是行為訊號,不是固定 thinking token 額度;API 與 Claude Code 預設 high
Fast mode最高約 2.5× output tokens/秒;US$10/US$50研究預覽、Claude API 限定;不是整個 request 保證快 2.5×
一般存取沒有 Fable/Mythos 的模型層級 30 日留存門檻不等於「不留資料」或自動取得 Zero Data Retention
資料來源:Anthropic 的 pricingOpus 5 規格Fast modedata retention 文件;查核日期 2026-07-25。

開發者可用固定 snapshot ID claude-opus-5呼叫模型;Anthropic 也把 mid-conversation tool changesserver-side fallback 一起放進 beta。前者必須在開場先宣告完整工具集合,再以 system message 改變當下可用工具;它不是任意重寫 tools array。後者則只處理 safety-classifier refusal,兩項功能都有額外的 beta 與平台限制。

真正值得注意的,不只是同價換到更高分,而是 Anthropic 對模型行為的這句描述:

Claude Opus 5 is much stronger at verifying its work and iterating carefully until it succeeds.

中文:Claude Opus 5 更擅長驗證自己的工作,並仔細反覆修正,直到成功。

Anthropic〈Introducing Claude Opus 5〉

這是整篇發布文最重要的一句。模型若只是一次產生更漂亮的答案,提升仍是線性的;但如果它能執行、檢查、發現錯誤、修正,再重新執行,微小的單步能力提升會在多輪代理流程裡累積。這也解釋了為什麼 Claude Opus 5 的亮點主要集中在 coding、電腦操作與具備明確驗收條件的商務工作流。

發布文也把提升延伸到科學研究與視覺輸出:Anthropic 報告 Opus 5 在自家公布的生命科學評測中,各項點估計均高於 Opus 4.8;其中由光譜資料推定分子結構高 10.2 個百分點,蛋白質序列—功能預測高 7.7 個百分點,並展示了更成熟的視覺作品。前者多屬 Anthropic 評測,後者是精選 demo,應視為待外部重測的訊號,而不是普遍成功率。

第一組證據:代理編碼大幅進步,但榜單測的是「模型+harness」

Anthropic 先拿 Frontier-Bench v0.1 當主舞台。內部圖表顯示,Opus 5 low 約為 25%,xhigh 以 44.4 達到峰值;max 約為 43%,與 xhigh 的差異落在雜訊內,仍明顯高於 Opus 4.8 max 的 18.7。FrontierBench 公開榜截至 2026 年 7 月 25 日也把 Opus 5+mini-SWE-agent 列在 43.53±1.65,領先 GPT-5.6 Sol+Codex 的 34.42±1.61 與 Fable 5+Claude Code 的 33.78±1.73。

Frontier-Bench v0.1 圖表比較 Claude Opus 5 不同 effort 的代理編碼分數與成本
Anthropic 內部 Frontier-Bench v0.1:Opus 5 在 xhigh 以 44.4 達峰值,max 約 43%、差異在雜訊內;每題取五次嘗試的平均,部分安全拒絕會改由 Opus 4.8 執行。圖/Anthropic

但「Opus 5 是榜首」不能直接翻譯成「底模本身領先 9 分」。不同模型搭配不同 agent harness,工具、提示、重試策略與運行環境都會改變結果。Frontier-Bench 公開結果較合理的讀法,是目前這個 Opus 5 系統組合表現最好。

成本 headline 也要拆開看。公開榜的 Opus 5 總評測 token 成本其實略高於 Opus 4.8;Anthropic 所說的「更低成本」來自同一套內部 harness 的單次 attempt 曲線,而且每題是五次嘗試後取平均。它證明 cost-performance curve 變好,卻不是「一次任務必定更便宜」。

還有一個容易被忽略的 footnote:這次內部跑分遇到 safety-classifier refusal 時,會改由 Opus 4.8 接手。System Card揭露,Opus 5 約 5% API calls/4% trials 觸發 fallback;Fable 5 更高,約 42% calls/26% trials。於是圖上的模型名稱,實際上已經是一個帶路由的系統,而不是純底模。

第二組證據:外部榜單支持「高性價比」,也暴露剩餘失敗率

CursorBench 3.2是最能支撐「半價逼近 Fable」的外部證據:Fable 5 max 為 70.5%、每題 US$17.32;Opus 5 max 為 70.0%、每題 US$8.23。這是差 0.5 個百分點,成本為 47.5%。Cursor 自己也提醒,小幅分差未必有統計意義——對採購者而言,這反而是好消息:兩者可能已接近同一能力帶,但價格不在同一帶。

ARC-AGI 3 的結果更戲劇化。ARC Prize 官方驗證榜(Semi-Private)顯示,Opus 5 high 得分 30.16%;GPT-5.6 Sol max為 7.78%,前者約為 3.88 倍。這支持「新穎問題解決能力出現跳升」,但不能被寫成「已經接近 AGI」:測試窗口很短、只有 high effort 完成 Opus 5 的 ARC-AGI-3 Semi-Private 測試。另一組 25 個 Public Demo 環境則是 5 個拿到 100%、17 個部分得分、3 個為 0%;不要把這個分布與 30.16% 混為同一統計量。

ARC-AGI-3 圖表顯示 Claude Opus 5 high effort 得分 30.16%
ARC-AGI-3 verified leaderboard(Semi-Private):Opus 5 high 為 30.16%;另一組 25 個 Public Demo 環境中,5 個拿到 100%、17 個部分得分、3 個為 0%。圖/Anthropic

商務工作流也呈現同一種雙面性。Zapier AutomationBench提供 600 多個公開研究任務,涵蓋 47 個模擬 app、約 500 個 API endpoints;排行榜另以 private held-out eval 評測,並用終態 deterministic assertions 做 strict pass/fail,不靠 LLM judge。截至 2026 年 7 月 25 日,Opus 5 max 為 26.2%/US$1.27,low 也有 22.4%/US$0.75,都是很強的結果;但 max 的另一種說法是:約 73.8% 任務仍未通過

AutomationBench 圖表比較 Claude Opus 5 不同 effort 的代理商務工作流通過率與成本
Anthropic 發布圖中的 AutomationBench:Opus 5 約落在 22%–26%;當前 Zapier 榜單的 max 為 26.2%,也意味著約四分之三工作流仍未通過。圖/Anthropic

Anthropic 圖中「同成本約為次佳模型 1.5 倍」是發布時快照,不能當作永續事實。當前 Zapier 榜單已加入 Gemini 3.6 Flash high 的 19.8%;26.2% 對 19.8% 約是 1.32 倍,而且成本不同。Opus 5 仍領先,但 headline 已經需要更新。

原文最吸引人的三個案例,為何只能算行為樣本

Anthropic 用三個案例把「驗證到成功」變得很具體:

  • 在看不到原始機械零件圖的設定下,Opus 5 自己寫電腦視覺 pipeline,從 raw pixels 還原幾何,再建立 FreeCAD 模型;
  • 處理開源套件管理器的真實 bug 時,它找到 root cause,還補上社群 patch 漏掉的 edge case;
  • 替交易公司接新交易所 market-data feed 時,因沒有 live feed 可核對,它另外做 test harness 驗證 parser。

這三個故事都對應同一個機制:模型不是只產生答案,而是主動創造可驗證的中間環境。不過,它們來自 Anthropic 與 early-access users 的精選案例;截至 2026 年 7 月 25 日,發布文沒有隨案例提供可用來估計 success rate 的分母、預先登錄或完整失敗分布。合理用途是理解模型可能呈現的行為,不是估計「你的任務成功率會提高多少」。

在 closed-book factual benchmark,它答對更多、也答錯更多

如果只讀發布文,很容易把「更會驗證」理解成「更少幻覺」。194 頁的 System Card 給出更複雜的答案:在 closed-book factual benchmark,Opus 5 的正確回答約從 Opus 4.8 的 60% 升至 71%,但不正確回答也約從 17% 升至 22%,因為 abstention 從約 23% 降到 7%。

也就是說,它變得更有能力、更願意作答,同時也更容易在不知道時繼續往前。System Card 還記錄了 overconfident claims、先捏造資料再戲劇性撤回,以及高 effort 偶爾過度思考、陷入自我修正迴圈的情形。這不是邊角料,而是「驗證到成功」這個優點的鏡像:如果驗收訊號本身不可靠,更多輪自我檢查只會讓同一套盲點反覆確認自己。

Anthropic 的內部研發評估也沒有支持「人類研究員即將被取代」:System Card 表示,Opus 5 尚未接近取代 Anthropic 的研究科學家或工程師,尤其是資深人員;公司內部也尚未觀察到可歸因於它、持續達到 2× 的 AI 研發加速。這與 coding benchmark 同時成立:局部任務大幅變強,不等於整個職務已被端到端取代。

「史上最 aligned」量到的是內部相對分數,不是事故率

發布文把 Opus 5 稱為 Anthropic 至今最 aligned 的模型。圖表中的 2.30,來自每個模型約 3,200 次 automated investigations、約 1,600 個情境 seed,由 Mythos 5 擔任 judge 的內部行為稽核;分數越低越好。

Anthropic 自動化行為稽核圖表顯示 Claude Opus 5 misaligned behavior 平均分 2.30
Anthropic 自動化行為稽核:Opus 5 的 misaligned behavior 平均分為 2.30,低於三個比較模型;這是 1–10 的內部相對評分,不是錯誤率。圖/Anthropic

2.30 不是 2.3%,更不是「只有 2.3% 機率出事」。它只表示在 Anthropic 這套 seed distribution 與 LLM-judge rubric 下,Opus 5 的平均 misaligned-behavior 分數低於 Opus 4.8、Mythos 5 與 Sonnet 5。發布頁的散文寫比較對象包括 Fable 5,但同頁圖表與 System Card 標的是 Mythos 5;因此這張圖不能直接證明產品層級的 Fable 5 比較。

「沒有推進危險能力前沿」也需要補完主詞。Anthropic 的精確判定是:Opus 5 沒有超越既有 Mythos 5 的風險前沿,也未跨過自家的 CB-2 與 automated-R&D 門檻;它相較 Opus 4.8 的 cyber 與生命科學能力仍明顯上升。更公平的描述是:它沒有刷新 Anthropic 已有的最高危險能力,卻把部分接近 Mythos 的能力帶到更低價格與更廣泛的可用層級。

部署端的 safeguards 也不是單一開關。Anthropic 的 System Card表示 Opus 5 大致沿用 Opus 4.8 的防護,只在狹窄的 cyber 範圍加強;一般 Claude 產品被 classifier flag 時預設改由 Opus 4.8 回答,Claude Vulnerability Program 可用限制較少的版本,而 Fable 5 被 biology safeguards 擋下的請求則改路由到 Opus 5。這些都是產品層級的 guardrail/routing 設定,不能混成底模本身的安全分數。

AlphaLab 的判讀:Opus 5 真正躍進的四個層次

一、它吃到的是「可驗證性紅利」

程式有 unit tests,GUI 有畫面狀態,商務工作流有資料庫終態,3D 模型可用幾何約束檢查。這些任務都能把「看起來合理」轉成「通過/不通過」,所以更強的迭代能力可以累積成可觀的完成率提升。

相反地,策略判斷、事實問答與開放式研究常沒有即時 ground truth。讓同一個模型再看一次,並不會自動產生獨立證據;System Card 的「答對更多、也答錯更多」正好提醒我們,self-verification 只有在外部驗收器可靠時才真正值錢。

二、模型排名正在變成一條 Pareto frontier

Claude Opus 5 不需要在每個 benchmark 絕對第一,才會成為更好的生產選擇。CursorBench 的 70.0% 對 70.5%,配上不到一半的 task cost,已經足以改變預設路由。真正的選擇題變成:你願意為最後 0.5 個百分點付多少錢?任務失敗的代價又是多少?

三、我們購買的其實是「模型+harness+router」

Effort、agent harness、工具權限、重試次數、judge、safety classifier 與 fallback 都會改變結果。Anthropic 新增的 API fallback 也是同一趨勢:開發者可 opt in,讓被 safety classifier 擋下的 request 依類別交給建議模型重試;它不是 overload、rate limit 或 server error 的通用容錯路由。

這件事的實務含義很大。跑評測時要記錄實際回傳的 model、工具與 effort;做採購時要問 deployment configuration,而不只問模型名稱。未來榜單若沒有揭露 harness 與 fallback,就像比較賽車卻不說輪胎與維修站策略。

四、它的戰略價值是把能力曲線往左移

Fable 5 仍是 Anthropic 公開模型中一般用途/frontier intelligence 能力上限更高者;Opus 5 的任務則是讓更多 workload 在經濟上可行。相同 Opus 4.8 價格、接近 Fable 的部分能力、較窄的模型層級留存門檻,會讓企業更願意把它放入預設路由。這比單一 SOTA 標籤更可能改變實際 token 流向。

我同意什麼/我存疑什麼

我同意:Claude Opus 5 確實是一次顯著的 cost-performance 升級;在具備外部驗收器的代理任務,它的驗證、修正與續跑能力很可能比單一 benchmark 分數更有價值。

我存疑:發布文把內部評測、model+harness 組合、帶 fallback 的結果與精選案例,壓縮成「模型本身的普遍屬性」。大部分數字都有來源,但它們支持的是特定設定下的相對優勢,不是零錯誤、全面安全或所有任務都更省錢。

最值得追蹤的預測:預設模型會不會從「最強」改成「最划算」?

Anthropic 真正在推銷的,不是「Opus 5 打敗所有模型」,而是「多數高價值任務不必再為最高上限付 Fable 價格」。這個命題很好對帳:未來幾個月,如果企業的自有 eval 在相同 harness、關閉 fallback、相同 retry budget 下,仍能重現接近 Fable 的完成率與明顯較低的成功任務成本,Opus 5 就會成為大量代理工作流的預設層;反之,它只會是另一個漂亮的發布日曲線。

你現在可以怎麼用 Claude Opus 5?

  1. 先建自己的驗收集,再選 effort。用 20–50 個真實任務測 low/medium/high/xhigh/max,記錄成功率、總 token、重試、人工介入與最終修正時間。不要只比較每次 API call 價格。可搭配我們的Claude 省 token 方法
  2. 把「請自我檢查」改成可執行的驗收器。程式就跑 tests/lint,資料流程就驗證 schema 與終態,研究就要求可點開的來源、逐步計算與反例。需要建立 agent 監控時,可先讀AI Agent 可觀測性
  3. 記錄實際模型與 fallback。若開啟 server-side fallback,保存 response 的 model 欄位;如果評測不記錄路由,日後就無法知道改進來自 Opus 5、Opus 4.8,還是 policy change。
  4. 高風險事實不要靠同一模型自證。法律、醫療、資安、財務與公開發布的事實,仍需獨立來源或人類 reviewer。Claude Opus 5 更積極作答,正是更需要 provenance 的理由。
  5. 比較的是工作流,不是粉絲隊伍。想理解 Claude 與 Codex 在代理編碼上的差異,可看Claude Code vs Codex;要選能力上限則延伸讀Claude Fable 5Claude Opus 4.8

一句話總結:Claude Opus 5 最值得買的不是「更聰明」三個字,而是它把驗證、修正與成本控制放進同一條代理迴圈;但只有當你的工作流提供可靠的外部答案,它才真的會迭代到成功。

📚 延伸閱讀


免責聲明與利益揭露:本文為 AlphaLab 對 Anthropic 公開資料與第三方 benchmark 的獨立評論,不構成投資、法律、醫療或資安建議。本文未受 Anthropic 贊助,文中沒有因推薦 Claude 而取得的聯盟分潤。原始數據與圖表著作權分屬 Anthropic、ARC Prize、Cursor、Zapier、FrontierBench 等原權利人;本文基於評論、研究與教育目的引用,所有測試結果均受版本、日期、harness、effort、工具與評測設計限制。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。