你在 Claude Code 裡修同一個專案,看到 Weave Router 2.0 宣稱可以把簡單工作交給便宜模型、難題再升級。帳單看似下降,卻可能多出重試、快取重建與人工收尾。Weave Router 2.0 真的省嗎?答案要在同一批任務完成後才算得出來。
這篇寫給第一次替 Coding Agent 配模型路由的讀者。你會學會分辨自架預設 scorer、可選 HMM 與代管服務,將固定 GPT-6.1 Sol 作為強而較便宜的基線,然後用成功率、快取、時間和總費用決定是否保留路由。你只需會開終端機、讀懂測試通過或失敗。
先說結論:省錢看「完成成本」
路由省錢=同任務成功交付的總成本下降,且品質與耗時仍符合你的門檻。把路由想成計程車派車台:派到便宜車只是起點;轉車、繞路、沒到目的地,都要算進車資。單次 API 請求的價格不能代替整件工作完成的成本。
Weave 在官方 2.0 文章報告相對 GPT-6 Astra 的節費與速度優勢;這是廠商在指定 Codex harness、任務集及 pass@2 條件下的結果。截至 2026 年 10 月 3 日,公開 benchmark 說明的 Sol 對照仍是 GPT-5.6 Sol,並把 Claude Code harness 列在範圍之外。這些結果回答不了你在 Claude Code 使用 GPT-6.1 Sol 時的問題。
Weave Router 2.0 在 Claude Code 裡做了什麼?
Claude Code 是替你讀檔、改碼、跑命令的工作介面;路由器則站在它與模型供應商之間,替每次模型呼叫選擇去處。Claude Code 的閘道文件說明了改走相容端點的架構。Weave 自己把最小決策單位稱為 action,也就是一次上游模型 API 呼叫;一個人眼中的「修好 bug」,通常包含多次 action。
截至 2026 年 10 月 3 日,自架設定文件把預設策略寫為 cluster:在本機程序中以 cluster scorer 選模型。HMM sidecar 是另行啟動與選用的策略;執行 make up-hmm 只啟動 sidecar,仍須查安裝層策略或獲授權的請求覆寫。代管入口的實際策略則以該安裝當時的設定與決策證據為準。看見產品名「2.0」,不等於你這次請求跑了 HMM。
要跟著操作,先在可丟棄的測試 repo 中確認 Node 版本達 18、已安裝 jq,再執行 npx @weave-os/router@0.2.28 --claude --scope project;依畫面完成授權後執行 npx @weave-os/router status --claude 與 npx @weave-os/router models --claude。這些命令和專案範圍設定見官方安裝說明。將該測試 repo 的 .claude/settings.json 變更一併記錄,才知道此次 Claude Code 指向哪個端點。

Weave Router 2.0 怎麼驗收?先鎖住四個條件
① 鎖「同一個題目」:用乾淨副本
挑一個可重複的 repo,寫下三類真任務:修一個有測試的 bug、做一個小功能、解一個需要跨檔案理解的錯誤。每題先固定起始 commit、提示詞、可用工具、驗收測試與最長時間。每個組別從同一 commit 的獨立 worktree 開始;前一輪改過的檔案不能帶進下一輪。工作樹就像考卷影印本,起跑內容不同,分數便失去比較意義。若你不熟 worktree,可先看Agent Harness 實作教學,理解執行層怎麼保管工具與停損點。
② 鎖「同一個比較對象」:固定 GPT-6.1 Sol
固定組在 Weave 路由端點使用 /force-model gpt-6.1-sol,另開乾淨 Claude Code session 跑同一題;路由組用 /unforce-model 恢復自動選模。每輪保存狀態、模型清單與已啟用的供應商。這種固定組仍經過同一閘道,較能隔離「選模」與「多一道代理層」;若還想量代理層開銷,另加直接供應商組,但 Claude Code 直接連 Anthropic 的組別無法視為 GPT-6.1 Sol 直連組。
OpenAI 官方模型頁截至 2026 年 10 月 3 日列出 gpt-6.1-sol 的標準 API 價格:每百萬輸入 token 2 美元、快取讀取 0.10 美元、輸出 10 美元。這只是定價簿,不是整題帳單;不同推理強度、長上下文與供應商計費方式都要記錄。本站的Claude Code 與 Codex 比較可幫你辨認 harness 差異,避免把不同介面混成同一組。
③ 鎖「實際路由策略」:不要把 scorer 與 HMM 合併
自架時記下 Git commit 或套件版本、ROUTER_DEFAULT_STRATEGY、安裝層已保存策略、/readyz 狀態與模型清單。make up-hmm 後還要證明安裝策略已選 HMM;若沒有能核對的策略證據,將結果標成「策略未確認」,不要寫成 HMM 成績。代管版請向管理者取得本次安裝的策略與版本記錄。若要區分預設 cluster 與 HMM,分成兩組,分別記錄設定及 sidecar 的 package digest,不把兩組平均成一個「Router 2.0」。
④ 鎖「計分規則」:成功、重試、快取與時間同時記
每題先判斷測試是否通過、需求是否完成;再記總模型費、手動重試費、cache read 與 cache creation token、未命中後重新輸入的 token、從啟動到通過測試的分鐘數。建議同一題每組至少多跑幾次,保留全部失敗紀錄,並列出「每次嘗試平均費用」及「每個成功任務平均費用」。後者用總費用 ÷ 成功任務數;若某組沒有成功,該值保持未定義,不能硬填零。
Weave 的session cost API可讀已提交的路由計價與快取 token;逐 action 匯出另記實際模型、故障切換、token 與費用。requested_cost 是按「原請求模型」估的反事實數字,不是你實際跑過的固定 GPT-6.1 Sol 對照組。訂閱額度內服務的請求也可能在路由計價中顯示 0;團隊仍應另記訂閱費及額度機會成本。
一次完整記錄長什麼樣?
假設題目是「修正搜尋欄位清空後仍保留舊結果」。先把驗收寫成:一個指定測試通過、操作錄影顯示清空後列表復原、沒有意外改動其他頁面。固定組與路由組都從同一 commit 起跑,提示詞完全一樣。看到路由組第一次測試失敗時,不立刻把它當作免費重試:把後續模型呼叫、等待與人工介入記入同一題。最後只有交付條件都滿足才記「成功」。這是記錄方法的示例,不提供虛構的測試分數。
你的工作表一列放一題、一組、一次嘗試。欄位依序為:起始 commit、提示詞版本、Claude Code 版本、Router 版本與策略、實際模型序列、成功/失敗、重試次數、輸入/輸出/cache read/cache creation token、實際帳單、總分鐘、人工收尾分鐘。每題結束後再把兩組並排;不要只挑路由成功的題目展示。若你需要先理解 cache 為何會影響帳單,可接著看Claude token 成本教學。
切換失敗後,怎麼停用、回滾與對帳?
- 先停用。在終端機執行
npx @weave-os/router off --claude,完全關閉再重開 Claude Code;以npx @weave-os/router status --claude確認已走直接供應商。這是 Weave 安裝文件記載的切換方式。 - 還原工作樹。保留失敗紀錄後,丟棄該次隔離 worktree,重新從鎖定 commit 建立副本。若曾在主工作樹操作,先檢查
git diff,逐檔確認再還原;不要在有未保存修改時直接執行破壞性重置。 - 對帳。將路由匯出資料按
session_id與request_id對回題目,核對供應商實際發票、重試及快取欄位。記得路由匯出是逐 action,不能直接把列數當成題目數;資料提交也可能晚於最後一個請求。若放棄整合,再用npx @weave-os/router --uninstall --scope project移除專案層設定。
回滾完成後,固定組與路由組都應重新做一次小型 smoke task:讀檔、改一行、跑測試,驗證權限和端點都回到預期。比起看一個「省下 X 美元」角標,這份記錄更能告訴你下一次是否值得開啟路由。想補齊執行與停損的概念,可讀Agent Harness 基礎。
Weave Router 2.0 常見問題
1. 裝好就一定在用 HMM 嗎?
不一定。目前自架設定的預設是 cluster;HMM sidecar 需要啟動並明確選用策略。以本次安裝記錄為準。
2. 看到代管版宣稱 HMM,能套用到自架嗎?
不能直接套用。部署策略、供應商、模型清單與快取狀態各自影響結果;先保存版本與策略證據。
3. 為何要選 GPT-6.1 Sol 當基線?
因為它提供另一個有競爭力的固定模型對照。截至 2026 年 10 月 3 日,OpenAI 官方把它定位為較低成本的複雜工作模型。是否適合你的 repo,仍看任務結果。
4. 官方 benchmark 的「半價」可以直接當預算嗎?
不行。那是廠商對指定 Astra 基線、Codex harness 與任務集的結果;比較對象換成 Sol,結論就要重算。
5. 只看 cache hit rate 夠嗎?
不夠。同時記 cache read、cache creation、未命中後的非快取輸入與總帳單;切換模型的成本可能延後出現。
6. requested cost 就是固定 Sol 的費用嗎?
不是。Weave 文件將它定義為原請求模型的估計成本。固定 Sol 要獨立跑一組,並用真實完成結果對照。
7. 某組比較便宜但常失敗,該選它嗎?
先看你的交付門檻。若成功任務更少、重試更久,就用每個成功任務的成本與時間判斷;價格較低不能抵掉未完成。
8. 怎麼快速撤回路由?
執行 npx @weave-os/router off --claude,重開 Claude Code 後查 status。保留原始執行記錄,先對帳,再決定是否卸載。
給新手的三個判斷點
- 先確認你測的是自架 cluster、自架 HMM,還是代管版;策略不明就不寫策略勝負。
- 固定 GPT-6.1 Sol 與路由組使用同一 repo、提示詞、驗收、時間上限,保留每次失敗。
- 以成功任務的總成本和耗時決定是否上線,並預先練習
off --claude回滾。
接著閱讀
左右滑動查看更多推薦
結語:先做一題,再決定要不要全開
Weave Router 2.0 值得試的地方,是它讓你有機會按任務挑模型;是否省錢,仍由自己的完成紀錄回答。先選一個有測試的小 bug,做固定 GPT-6.1 Sol 與路由各一輪,填上成功、重試、快取與分鐘數;再決定下一批任務要不要擴大。若你想把這套驗收延伸成完整 Agent 工作流,可從AlphaLab 課程挑一條實作路線。
