跳到主要內容

Claude Sonnet 5.5 深度解讀:同價升級,70.6% 與 53.03% 怎麼看?(2026)

最後更新: ·
Claude Sonnet 5.5 同價升級與成本判讀封面

2026 年 9 月 28 日,Anthropic 在官網發布〈Introducing Claude Sonnet 5.5〉,宣布 Claude Sonnet 5.5 上線。它主打與 Sonnet 5 相同的 API 單位價格,卻能更快、更省地完成日常工作。這篇發布文最值得拆開看的,不是「升級」兩個字,而是價格、每件任務的用量,以及不同測試方法得出的成績。

Anthropic Claude Sonnet 5.5 官方發布頁首頁截圖
點圖閱讀 Anthropic 原文。圖/Anthropic 官網截圖

先看原文如何描述模型定位,再把官方數字與外部測量放在一起;最後回到一個實際選型問題:完成同一件工作,哪個模型花得少、錯得少?

Anthropic 賣的是「同價但每件工作更省」

Anthropic 把 Claude Sonnet 5.5 放在 Opus 5.5 之下:Opus 處理需要長時間判斷的開放式任務,Sonnet 5.5 接手範圍明確的程式修復、文件、簡報與試算表。官方列出的 API 標價是每百萬輸入 token 2 美元、輸出 token 10 美元;這與它宣稱的 Sonnet 5 價格相同。Anthropic 定價文件也列出 Sonnet 5 的這組價格。

it costs up to 30% less per task than its predecessor.

中文:每項任務的花費,最多比前代低三成。

Anthropic〈Introducing Claude Sonnet 5.5〉

這句話的關鍵是「每項任務」,不是「每百萬 token」。Anthropic 說新模型通常用更少 token 做完同一件事,輸出速度也快 30% 以上;兩個百分比都出自 Anthropic 自己的測試,原文沒有提供可直接套用到所有工作流程的固定省幅。

70.6% 與 53.03%:為何同一模型有兩個成績?

Anthropic 在自己的 Terminal-Bench 4.0 設定下,報告 Claude Sonnet 5.5 得到 70.6%,Sonnet 5 得到 10.3%。原文的成本對成績圖更清楚地表達它的主張:提高推理努力檔位,成績通常上升,但每次嘗試也更貴。

Anthropic Terminal-Bench 4.0 成績與每次任務成本圖
橫軸是每次嘗試成本,縱軸是得分;不同點代表不同努力檔位。圖/Anthropic 官方圖表截圖

外部測試機構 Vals AI 的原始測試頁則在自己的 Terminal-Bench 4.0 測到 53.03% ± 1.51,並列為該項測試 37 個模型中的第 3 名。Vals 說它多數測試使用 Max effort,且讓部分被拒絕的請求由 Sonnet 5 伺服器端接手;若把這類 fallback 協助成功的任務改算失敗,該項得分成為 50.51%。

70.6% 與 53.03% 不能直接相減成「官方灌水了 17.57 個百分點」。測試執行環境、努力檔位、工具與 fallback 計分都可能不同。兩組數字能共同支持較窄的結論:這款模型在多步驟終端任務上值得測試;它們不能替你的程式庫、工作流程或成本預算保證相同結果。

外部排名很強,但領先幅度仍要細看

Vals AI 在 2026 年 9 月 28 日的 Vals Index,把 Claude Sonnet 5.5 列為 66 個模型中的第 2 名,綜合分數 69.22% ± 0.96;Opus 5.5 是 69.69%。相差 0.47 個百分點,小於該頁列出的 Sonnet 5.5 誤差幅度。Vals 的單次測試成本是 Sonnet 5.5 20.80 美元、Opus 5.5 32.77 美元;這是 Vals 測試組合的花費,不能當成你的 API 帳單預測。

benchmark scores capture only one facet of a model’s capabilities

中文:跑分只捕捉模型能力的一個面向。

Anthropic〈Introducing Claude Sonnet 5.5〉

Anthropic 自己也把 Opus 留給複雜、開放式、需要持續判斷的工作。這一點與 Vals 頁面呈現的細項差異並不衝突:Sonnet 5.5 在部分程式任務表現突出,但不同專業任務的名次並不一致。若只看綜合第 2 名,就容易把「適合某類工作」誤讀成「適合所有工作」。

我的判讀:便宜的是被驗收的成果,才不是輸出 token

我同意什麼

在標價相同的前提下,如果一個模型能用較少步驟交付同等品質,單件工作的成本就會下降。Anthropic 的內部對照與 Vals 的外部排名,都使 Claude Sonnet 5.5 成為值得放進候選清單的模型。對範圍清楚、可自動驗收的程式修復,這個價值尤其容易量化。

我存疑什麼

「最多省 30%」缺少可普遍套用的工作樣本;「輸出快 30% 以上」也不等於包含工具、排隊與人工複核的整體交付時間快 30%。Vals 也記錄了 fallback 的影響。只看模型輸出速度、token 單價或單一總分,會把重試、拒絕與驗收成本藏起來。

怎麼決定要不要換到 Sonnet 5.5?

取一組自己真會交付的任務,讓 Sonnet 5、Sonnet 5.5 與你目前使用的高階模型各跑同一批。先固定提示、工具與驗收標準,再記錄四件事:通過率、完成時間、每件合格成果的總 token 成本、人工修改量。把拒絕、fallback 和重試另列,才看得出差距來自模型能力,還是測試路徑。

如果 Sonnet 5.5 在這組任務上交出相同品質、較低的每件合格成果成本,就先把範圍明確的工作交給它;需要長時間規劃與判斷的任務,保留更強模型作為對照。這比把任何一張排行榜當成全域切換開關可靠。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。