2026 年 9 月 22 日,Anthropic 在官網發布〈Introducing Claude Opus 5.5〉,把 Claude Opus 5.5 定位成新一代旗艦:更強、更快,API 輸入與輸出單價都比 Opus 5 低 20%。真正值得追問的卻不是「它有沒有登頂」,而是便宜的 Token,是否真的換成更便宜的完成任務成本。

下面先忠實整理 Anthropic 公布了什麼,再把官方跑分與 Artificial Analysis 的第三方評測放在一起對照,最後回答三個實際問題:58 分代表什麼、20% 降價為何未必省錢,以及哪些工作值得升級。
Claude Opus 5.5 的核心主張:能力升級,效率才是主角
Anthropic 的發布文不是只賣一張榜單。它把故事拆成四條線:模型在 Agent Coding、電腦操作與知識工作上進步;預設設定的典型工作負載成本較 Opus 5 低 40%;寫作更簡潔;同時加入更嚴格的資安、生物與蒸餾防護。官方也承認,前沿模型之間的 benchmark 差距,愈來愈不等於真實工作中的體感差距。
On our benchmarks, Claude Opus 5.5 leads in agentic coding, computer use, and knowledge work.
中文:在 Anthropic 自己公布的評測中,Claude Opus 5.5 領先 Agent Coding、電腦操作與知識工作。
Anthropic,〈Introducing Claude Opus 5.5〉
規格面則很明確:官方模型文件列出的 API 模型 ID 是 claude-opus-5-5,支援文字與圖片輸入,Context Window 為 100 萬 Token;標準 API 價格是每百萬輸入 Token 4 美元、輸出 Token 20 美元。這些是產品規格,不等於你的實際帳單會自動下降。
58 分登頂:Artificial Analysis 到底量了什麼?
Artificial Analysis 的原始評測顯示,Claude Opus 5.5 在 max effort 的 Intelligence Index 得到 58 分,為該機構截至 2026 年 9 月 22 日量到的最高分,並在十項組成評測中的六項取得領先。這個指數 v4.3.2 混合了 Humanity’s Last Exam、SciCode、Terminal-Bench 4.0、GDPval-AA、AA-Briefcase 等十組測試,因此 58 是加權綜合分,不是「正確率 58%」。
這裡有兩個容易被標題吃掉的細節。第一,Opus 5.5 並非每一項都第一:Artificial Analysis 明列它在 CritPt、AA-LCR 與 GDP.pdf 落後;Anthropic 自己的表格裡,GPT-6 Astra 也在 AutomationBench 與 Terminal-Bench-Science 取得更高數字。第二,不同模型使用的 effort、工具、fallback 與 harness 可能不同,不能把跨表格的單點數字當成完全同條件的競速。

因此,「獨立智慧榜第一」可以證明這個模型在一組廣泛測試上很強,卻不能直接推出它在你的程式庫、研究流程或簡報工作上一定最好。若要把榜單讀對,可先看 Fable 5.1 vs GPT-6 Astra:兩張 AI 榜單為何不能直接比;同一個模型在不同 harness 下,排名本來就可能改變。
降價 20%,為什麼最高 effort 的任務成本只打平?

官方價格表沒有問題:輸入從 5 美元降至 4 美元、輸出從 25 美元降至 20 美元、Cache Read 從 0.50 美元降至 0.20 美元。後者等於相對於未快取輸入價格便宜 95%,但它只對重複讀取且成功命中快取的 Token 生效,不能套到全部輸入,更不能抵銷無限制增加的推理與輸出。
Level with Opus 5 on cost per task despite 1.6x the output tokens.
中文:即使輸出 Token 是 1.6 倍,Claude Opus 5.5 的每任務成本仍只與 Opus 5 大致打平。
Artificial Analysis,Claude Opus 5.5 評測
Artificial Analysis 測得,max effort 的 Opus 5.5 每個 Intelligence Index 任務約消耗 11.9 萬輸出 Token,Opus 5 約 7.3 萬;雖然單價低 20%,輸出量卻高約 60%。其成本方法會把輸入、快取命中、快取寫入、推理與答案 Token 全部計入,再依十項評測權重換算每項任務成本。這就是「Token 變便宜,任務沒有更便宜」的數學。
這也解開了官方與第三方看似矛盾的說法。Anthropic 的「典型工作負載省 40%」談的是預設設定與其測試組合;Artificial Analysis 的「成本打平」談的是 max effort 的指數任務。兩者可以同時成立。真正該比較的不是價格表,而是完成同一個可驗收成果,需要多少總 Token、幾次重試、多久,以及最後是否通過。若你已經在 Claude Code 長任務裡燒掉大量 Context,可搭配 Claude 怎麼省 Token建立用量基線。
安全不是一句「史上最安全」:System Card 同時寫了進步與缺口
Anthropic 的 Opus 5.5 System Card顯示,主要自動化行為稽核約使用 1,900 個情境描述,形成約 4,000 次調查;它在多數誤用、失調與誠實度指標上優於近期 Claude 模型。不過同一份報告也記錄一個小幅 Prompt Injection 回歸,並提醒絕對分數會受情境分布與模型評審影響,主要用途是模型間比較。
另一個常被濃縮成大數字的例子是沙箱越界:Opus 5.5 在 28 個手工情境、每題重跑七次的評測中,有 1.5% 出現低嚴重度的越界嘗試;官方把它概括為較 Opus 5 或 Mythos 5.1 少約 85%。這是值得肯定的方向,但樣本是刻意設計的模擬情境,不是「長時間 Agent 已經不會越界」的保證。AlphaLab 先前整理的 Claude 資安事件與對齊邊界,可補上為什麼 production safeguard、權限與外部驗收仍不可省。
更有意思的是,METR 的預部署測試認為 Opus 5.5 對 AI 研發自動化只比 Fable 5.1 稍強,仍不太可能完整自動化 AI R&D。這與 58 分並不衝突:綜合 benchmark 可以快速上升,長期、開放式、需要自己發現錯誤與維持目標的工作,仍是另一種難度。
AlphaLab 的判讀:這是更好的工作模型,不是免費的智慧升級
我同意:Opus 5.5 把「高能力」往可日常使用推了一步
最有價值的進步不是單一榜首,而是四個 effort 檔位同時站上 Artificial Analysis 的 Intelligence/Cost Pareto Frontier。這代表你不必每次都開 max 才能買到高品質;對程式碼遷移、跨文件分析、長時段研究這類本來需要多輪重做的工作,中等 effort 若能少一次失敗,總成本就可能真的下降。相較前代,可先把 Claude Opus 5 深度解讀當成基準,觀察「驗證到成功」是否在你的任務上變得更穩。
我存疑:max effort 的漂亮分數,可能把效率紅利吃回去
11.9 萬輸出 Token 不是小數字。當評測允許模型花更多推理與答案長度,分數上升可能同時來自「更會想」與「想得更多」。對錯一次代價很高的研究與工程任務,這筆成本可能合理;對摘要、改文案、單檔修補或已有強測試的工作,max effort 反而可能把延遲、費用與審查負擔一起放大。
所以 Claude Opus 5.5 的正確定位不是「所有工作的新預設」,而是先以 medium 建立完成率,再把 high/xhigh/max 留給錯一次更貴、且有可靠驗收的任務。模型更強之後,選 effort 會比選模型名稱本身更影響成本。
怎麼決定要不要升級 Claude Opus 5.5?
- 先固定三到五個真實任務。不要只丟一次 demo;選一個程式碼任務、一個長文件任務、一個需要工具的研究任務,先凍結輸入與驗收標準。
- 從 medium 對照現行模型。記錄成功/失敗、總輸入、Cache Read、輸出 Token、重試次數與 wall time;不要只看單次報價。
- 只有驗收失敗才逐級加 effort。如果 high 沒有提升完成率,max 的額外 Token 就不是投資,而是更昂貴的同一個結果。
- 用每次成功成本做最後決策。把所有成功與失敗 run 的費用加總,再除以通過驗收的次數;這比「每百萬 Token 便宜 20%」更接近你真正要付的錢。
若懷疑模型升版後「降智」或路由漂移,可直接套用 AI 模型 Shadow Eval的做法,把同一批題目、同一套驗收與同一預算跑在新舊模型上。Claude Opus 5.5 最重要的問題不是「榜單第一能維持多久」,而是它能否在你的工作裡,用較少的失敗換回更多可交付成果。
接著閱讀
左右滑動查看更多推薦
現在最值得做的不是立刻把所有流程切到 max,而是拿一個本週真的要交付的任務,先用 medium 與現行模型各跑一次,讓完成率與每次成功成本替你選模型。






