跳到主要內容

【2026 最新】Claude Sonnet 5.5 vs Opus 5.5 怎麼選?三個真任務測模型與 Effort(Claude Code 教學)

最後更新: ·
Claude Sonnet 5.5 vs Opus 5.5 教學首圖

你打開 Claude Code,要修一個小 bug,卻卡在「Claude Sonnet 5.5 vs Opus 5.5」:Sonnet 的 API 單位價格較低,是否每次都該選它?換成模糊的跨檔重構,答案可能又不同。最容易花冤枉時間的,不是選錯一次,而是用某個人的單次跑分替自己的所有工作下結論。

這篇 Claude Sonnet 5.5 vs Opus 5.5 教學,寫給第一次想在 Claude Code 裡選模型與 Effort 的讀者。你只要會打開專案、知道怎樣判斷工作完成,就能照著三種真任務建立自己的選型表。文中的任務卡是可照抄的示範,不是 AlphaLab 宣稱已經跑出的模型勝負。

先說結論:選型看合格成果,不看單次回覆

一句話記住:最划算的模型 × Effort =在你的驗收標準下,最穩定交出合格成果、且總投入最低的組合。把 token 單價想成計程車每公里收費;真正要比較的是到達目的地要繞多少路、是否下錯站,以及你花多久確認。

  • 先用 Sonnet 5.5 的 medium 當日常任務起點,再拿同題的 Opus 5.5 medium 作對照;這是實驗起點,不是普遍贏家。
  • 每題都先寫「完成」的證據;小 bug 看回歸測試,文件看事實與可讀性,模糊重構看邊界與未解風險。
  • 把 API 實際費用、訂閱用量與人工驗收時間分欄記。未過關的嘗試也算成本。

Claude Sonnet 5.5 vs Opus 5.5:先弄懂三個旋鈕

截至 2026 年 9 月 29 日,Anthropic 的 Sonnet 5.5 發布頁把 Sonnet 定位於範圍清楚的日常工作,Opus 定位於需要持續判斷的複雜開放工作。這是產品定位,尚未替你的 repo 測出結果。官方模型總覽列出 API 模型 ID claude-sonnet-5-5 和 claude-opus-5-5;在 Anthropic API 上兩者的每百萬輸入/輸出 token 標價分別是 US$2/10 與 US$4/20。

Sonnet 5.5 與 Opus 5.5 的模型、努力檔位與任務成本比較卡
截至 2026 年 9 月 29 日的 Anthropic API 標價;完成成本還要看用量、重試與驗收。

模型是找誰工作,Effort是允許他在每一步花多少心力,任務成本是拿到合格交付品之前的總帳。Claude Code 模型與 Effort 文件列出兩款模型都可選 low、medium、high、xhigh、max;同名 Effort 在不同模型上並非相同推理量。官方發布文說 Claude Code 中預設是 medium,而 Claude Platform 預設是 high,別把不同入口的結果混在一起。

另一個容易漏掉的旋鈕是執行環境。Claude Code 的 sonnet、opus 是可變別名;官方文件列明在某些雲端供應商上,別名當下可能指向較舊版本。比較時請用完整模型 ID,並在每輪的工作紀錄寫下畫面顯示的實際模型與 Effort。

三個真任務:先定義「贏」是什麼

① 小 bug:測試先紅再綠

從你手上真的待修的問題選一個,例如表單重複送出。先留下可重現步驟與一個會失敗的回歸測試;任務卡寫:「只修表單送出邏輯,不改登入與資料庫;完成時指出改動檔案,執行指定測試,再讓我手動按一次。」如果模型說「修好了」,卻沒有讓原失敗情境通過,就記為未完成。

② 文件:讀者能照著做,而且資訊可核對

選專案裡一頁真要更新的操作文件,例如新同事安裝流程。任務卡寫:「讀現有指令與設定,修正 README 的三個過時步驟;不要改執行程式;逐條指出對應檔案或實際指令。」驗收時讓另一人按文件走一遍,記下卡住的地方。文件漂亮不代表步驟正確;人工核對時間要列入同一張表。

③ 模糊重構:先看它怎麼處理未知

挑一項跨多檔、需求還有灰區的重構,例如把通知邏輯從路由拆出。任務卡先列「哪些行為必須維持」「哪些檔案可改」「哪些副作用不能碰」,並要求先說清未知與驗收方法。評分不只看 diff 多乾淨,更要看模型是否先確認含糊的產品決策、是否留下可測的遷移路徑。

這三題刻意分別考驗明確修復、事實性寫作、持續判斷;先用它們找路由規則,再逐步換成你真正重複做的任務。若想知道工具本身和模型有何差別,可以接著讀 Claude、Claude Code、Cowork 怎麼選。

六步配對測試:讓結果可重跑

第 1 步|固定起點

記下 repo 的同一個 Git commit、相同測試環境、同一份任務卡與同樣的工具權限。各組從該 commit 開新的工作目錄或重設到完全相同狀態;不要讓第一組改過的檔案漏給第二組。可用 git rev-parse HEAD 留下起點。需要更完整的隔離觀念,可看 Worktree 與資料庫回滾教學。

第 2 步|固定停止與成功條件

寫下「何時停止」:例如一輪交付後即驗收,若測試失敗可補一次;超過你願意投入的時間就停。把你自己補做的修正與驗收分鐘數列入;否則一組靠人救回來,另一組靠模型自己完成,兩邊其實不是同一把尺。

第 3 步|依序跑四種組合

在 Claude Code 的新會話先用 /model claude-sonnet-5-5,再用 /effort medium;第二輪改 /effort high。從原始起點重開,再用 /model claude-opus-5-5 跑 medium 與 high。官方操作文件也允許以 claude --model claude-sonnet-5-5 --effort medium 啟動單次會話。先用這四格作低成本對照;若某題卡在門檻附近,再測 low、xhigh 或 max。

第 4 步|逐輪記收據

每輪結束在 Claude Code 輸入 /usage,記下實際模型、Effort、token 分項、工作時間、工具呼叫、重試次數、測試結果與人工修正分鐘數。官方用量文件說明 API 使用者可讀工作階段費用;Pro/Max 訂閱者看到的美元值是按表價估算,不能當作當次實際帳單。訂閱用量請看方案使用條,API 額外支出請看帳單;兩者分欄。

三種任務、四種模型與 Effort 組合的配對測試工作表
空白工作表:每個任務都記成功條件、完成與否、時間、用量、重試與人工驗收。

第 5 步|先比較通過率,再比較完成成本

工作表先把「通過原定標準」標成通過/未通過;未通過不能用「回覆比較快」當作勝利。對 API 帳本,先把一組所有嘗試的實際費用加總,再除以合格件數;對訂閱帳本,記用量條的變化與人力時間,不硬換算成每題美元。樣本很少時,直接列出每題結果與失敗原因,比一個漂亮平均數更誠實。

第 6 步|交換順序,重跑值得重跑的題

第二次把模型先後順序倒過來,避免你看過第一次答案後,無意中給後面一組更好的提示。若只跑一遍,結論只能說「這次在這題怎麼樣」。同題不同輪若結果反覆,表示需要多一些任務樣本,或先把任務卡和驗收寫清楚。這也是 AI 模型路由與 Eval 教學 所談的核心:用自己的工作集驗證路由。

Claude Sonnet 5.5 vs Opus 5.5:怎麼把四格結果變成路由?

先畫一條品質底線:例如功能測試必須通過,文件不能包含無法核對的指令,重構不能偷偷改外部行為。達標的組合之間,再比 API 完成成本或訂閱用量、等待時間與人工修補。若 Sonnet medium 過關且驗收省力,日常同類工作先用它;若只在高 Effort 過關,就比 Sonnet high 和 Opus medium;若 Opus medium 明顯少返工,讓它接該類任務。

Claude Code 模型與 Effort 的三步選擇流程
先過品質門檻,再比完成成本;邊界附近先提高 Effort 或升級模型。

不要把「先試 Sonnet」當成所有工作都要先付一次試錯費。對一次失誤代價高、需求開放或驗收難的工作,可直接把 Opus medium 放進起點。反過來,能自動驗收的小 bug 就不用每次都升到最高 Effort。想理解 Opus 檔位的細節,可讀 Opus 5.5 Effort 檔位教學;想壓低無效用量,可讀 Claude 節省 token 的方法。

三個容易讓比較失真的坑

  • 把「半價」當成每題半價:官方 API 輸入與輸出單價是兩倍關係,但快取讀取價格相同,而且模型可能用不同 token、工具步數與重試次數。把完整帳單和成功率放一起看。
  • 把跑分當成個人交付率:Anthropic 的 Terminal-Bench、FrontierCode 等測試有固定題庫與設定;官方自己也說高 Effort 可能因額外審查和超時而在某項評測掉分。它們是選測試候選的線索,不是你的 repo 的保證。
  • 混用登入與版本:同一組測試要記錄供應商、實際模型 ID、Claude Code 版本與 Effort。官方文件指出 Sonnet 5.5 需要 Claude Code v2.1.284 以上,Opus 5.5 需要 v2.1.280 以上;若本機較舊,先執行 claude update 再核對畫面。

FAQ:新手常問的八題

Q1:Sonnet 5.5 的 token 價格真的是 Opus 一半嗎?

看項目。2026 年 9 月 29 日 Anthropic API 標價的輸入與輸出項目各是一半;快取讀取同價。完成一件工作要把實際用量與重試放進來。

Q2:一開始就選 max Effort 比較保險嗎?

不一定。較高 Effort 通常花更多時間與 token;先用 medium 建立基線,只有品質門檻過不了、或高難度任務證明有收益時再升。

Q3:Sonnet 和 Opus 用同一個 medium,公平嗎?

公平的是相同任務與驗收條件;medium 是各模型自己的刻度。工作表記清檔位,別假定它們耗費相同推理量。

Q4:只跑一題就能選全公司的預設模型嗎?

不能。單題只能說明那題的結果;把不同難度、類型和失敗代價的真任務分開,累積多輪再定預設與升級條件。

Q5:Claude Code 的 /usage 美元值就是訂閱帳單嗎?

不是。官方說 Pro/Max 的工作階段美元值按 token 表價估算,不代表當次實際收費;看訂閱用量條,與 API 帳單分開記。

Q6:可以用 sonnet 與 opus 別名代替完整 ID 嗎?

可以操作,但比較時更適合固定完整 ID。別名會隨供應商與版本解析;記下每輪實際顯示的模型。

Q7:測試失敗後讓同一模型再修一次,還算同一輪嗎?

可以,只要四組採用相同重試上限,且把補救時間、token 和人工介入都算進總投入。

Q8:我不會寫測試,從哪題開始?

先選一份文件任務,寫下三個可人工核對的成功條件;等會記工作表,再挑有現成測試的小 bug。

給新手的三個重點

  • 先寫清楚合格成果,再讓四個模型 × Effort 組合做同題比較。
  • API 費用、訂閱用量、人類審查時間分三欄;失敗與重試也算投入。
  • 用每一類工作的驗收結果建立路由,不把官方跑分或單次經驗變成萬用結論。

接著閱讀

左右滑動查看更多推薦

結語:今天就從一張任務卡開始

找一個你下週真的要交付的小 bug,寫下原始 commit、重現步驟、成功條件和停止規則。先跑 Sonnet 5.5 medium,再從同一個起點跑 Opus 5.5 medium,填完通過與否、完整用量與你自己的驗收時間。當你能說出「這類任務為什麼升級」,選模型就不再靠印象。想把這套判斷用到更多工作,接著看 AlphaLab 課程。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。