跳到主要內容

Claude Haiku 5.5 發表:短提示低價、100K 門檻與小模型分工(2026)

最後更新: ·
Claude Haiku 5.5:低價,先看提示長度

2026 年 10 月 7 日,Anthropic 在官網發布了〈Introducing Claude Haiku 5.5〉。Claude Haiku 5.5 把短提示的 API 基礎費率壓低,讓頻繁的小工作更值得交給模型;但超過 100,000 tokens 的提示,會進入另一套價格。讀懂這次發布,要把每 token 的牌價、實際工作量與成果品質一起看。

Claude Haiku 5.5 官方發布文章截圖
點圖可閱讀原文。截圖/Anthropic 官網;加上瀏覽器外框。

先看公告真正承諾了什麼,再用定價、遷移文件與獨立測試核對,最後判斷:哪些工作可以多跑,哪些仍值得留給較大的模型。

Claude Haiku 5.5:便宜的重點,是頻繁而明確的小工作

原文把摘要、對話壓縮、分類、查詢與 coding subagent 放在中心:讓較大的模型負責整體規劃,小模型處理其中可單獨交付的工作。想像一份報告要查十個欄位;每次只把必要資料和一個問題交出去,往往比叫每個助手重讀整份專案更容易算帳。這是分工的用途示意,並非 AlphaLab 的模型實測。

Haiku 5.5 is especially good value when used for tasks with prompts up to 100,000 tokens

中文:Haiku 5.5 對提示不超過 100,000 tokens 的任務,尤其有價格優勢。

Anthropic,發布文章 Pricing 段落節錄

模型概覽確認標準 API 的 100 萬 token 上下文窗口、128K 最大輸出與模型 ID claude-haiku-5-5。能裝下很長的內容,不代表整個窗口都享有最低費率。128K 也是標準模式的輸出上限,不能當成可見答案的保證長度。

Claude Haiku 5.5 定價:100K 前後,輸出也換費率

下表依 2026 年 10 月 8 日查核的 Claude Platform 定價文件整理,單位均為美元/每百萬 tokens;這是原廠標準 API 價格,透過其他平台使用需核對那條路由的價目。門檻看的是提示長度,100,000 正好仍在低價級距。

項目Haiku 5.5 ≤100KHaiku 5.5 >100KHaiku 4.5
一般輸入0.100.501.00
輸出0.502.505.00
快取讀取0.010.050.10
5 分鐘快取寫入0.1250.6251.25
1 小時快取寫入0.201.002.00

超過門檻時,Haiku 5.5 的一般輸入、輸出與快取費率都提高五倍;相對 Haiku 4.5 的公開每 token 費率,這個長提示級距仍低 50%。因此,不能把「超過 100K」讀成「比舊模型更貴」,也不能把九成降價套到所有請求。

先用一個窄例子感受規模:假設每次有 10,000 個未快取輸入 tokens、1,000 個計費輸出 tokens,按低價級距計算是 0.0015 美元;10,000 次就是 15 美元。這只算這兩項 token 用量,若實際輸出含更多思考、重試或工具服務,應把那些工作另計。省錢的機會來自大量重複呼叫,驗收也要以完整任務為單位。

Tokenizer 改了:同一份文字,不一定還在同一級距

官方遷移文件指出,相同文字在新 tokenizer 下約會產生比 Haiku 4.5 多 30% 的 tokens,增幅依內容而異。原本接近門檻的文件,換模型後可能跨過 100K;先用新模型重新計數,比把舊用量乘新單價可靠。

Simon Willison 的當日測試提供了不同尺度的觀察:他的同一段長提示約增加到 1.25 倍 tokens。這是他的樣本,不與文件的近似值矛盾,也不能替所有繁中、程式碼或長對話訂一個固定換算率。

對你的工作而言,最該先找的是提示長度的分布:多少請求遠低於 100K,多少卡在附近,多少早已超過?平均值會把門檻附近的個案藏起來。固定規則、附件和歷史對話都應納入檢查;「這次只問一句話」未必代表整個送出的提示很短。

跑分與實測:小模型變強,仍有分工邊界

Anthropic 公開的 Haiku 5.5 benchmark 比較表
圖/Anthropic。這是公司發布的評測表,保留任務、版本與有無工具等口徑;並非 AlphaLab 跑分。

原文的評測表涵蓋知識工作、電腦操作、推理、程式與圖表理解。應把每一列當成特定任務與設定的結果,不能把它們合成「所有工作都勝出」。例如公司表中的 Terminal-Bench 4.0,Haiku 5.5 為 39.2%,Sonnet 5.5 為 70.6%;這支持繼續評估小模型的進步,也留下複雜多步程式工作的差距。

Willison 另用「騎腳踏車的鵜鶘 SVG」比較不同 effort。他記錄 low 約 7 秒,max 約 5 分 9 秒;這是一位作者在這個創作題與跑次的觀察。它提醒我們,費率低不會自動消除等待,調高 effort 也會改變產出與工作量。這些秒數不能當作一般客服或 coding 任務的延遲保證。

他的文章把新模型描述為不能關閉推理;現行 官方 Haiku 5.5 提示指南則列出:low、medium、high 可關閉 thinking,xhigh 與 max 不可。採用前應依自己的 API 配置核對;這個差異正好說明,單次測試與完整功能契約要分開。Adaptive thinking 預設開啟,effort 預設為 medium。

Sonnet 快取降價,是另一張帳

10 月 7 日的 官方更新紀錄確認 Sonnet 5.5 的快取讀取由每百萬 tokens 0.20 美元降至 0.10 美元。它降低的是命中快取那部分的成本,沒有把輸出和一般輸入同時打五折。

若你的流程重複使用相同前綴,快取讀取占比可能很大;若常改前綴、很少命中,節省便不同。原文提出的 Sonnet Agent 工作約省兩成,是公司對其工作負載的估計,不是每位使用者的固定折扣。比較兩個模型時,應保留快取讀、寫、一般輸入和輸出的分項帳單。

同一份公告還宣布,當週將向 Max/Team 訂閱者推出每月 API credit,並為 Python/TypeScript SDK 加入電腦與瀏覽器操作 beta 支援。這些是各自的產品更新;可用的帳號額度與 SDK 功能,不應被混算成 Haiku 每 token 的降幅。原文亦報告對齊評測改善及相較 Haiku 4.5 更嚴格的資安防護;這些仍是官方測量與部署政策,並不替你的工具權限或資料路徑完成驗收。

AlphaLab 的判讀:便宜,應該換來什麼?

一、先讓小工作有明確交付

模型分工的價值,取決於邊界是否清楚。擷取欄位時要求來源位置,分類時保留不確定類別,摘要時要求能對回原文;這些成果更容易驗。若每次分工都丟出整份資料,或主模型仍須重做全部工作,低牌價很可能被重複閱讀吃掉。

二、以合格成果算成本

一個便宜的錯誤答案,可能使你再跑模型、再查資料、再請人修正。比較時把所有嘗試費用加總,再除以通過同一驗收的成果數;另外記錄完成時間與需要人工處理的比例。這會讓「可以多試幾次」變成可衡量的選擇,而不是自動把更高並行當成進步。

三、長窗口是一種選項

對需要整體脈絡的工作,長提示可能有必要;對可局部解決的查找,先挑出必要材料則更值得試。不要為了守住門檻盲目截斷:少掉關鍵上下文所造成的漏答,也要算在成果品質裡。目標是找到資訊足夠、費用合理的提示,而非追一個最小 token 數。

四、把能力成長轉成可撤回的選擇

我同意原文的方向:更便宜而有能力的小模型,讓摘要、分類與窄範圍子任務更有試驗空間。我存疑的是直接從公司跑分或單題創作,跳到「可以全面替代大模型」。先替一種已有答案的小工作建立對照,保持能切回原流程,才能知道這次進步是否落到你的使用情境。

現在值得做的第一件事

挑一類高頻工作,保留一批你有權使用、已能判對錯的樣本。凍結成功條件,讓 Haiku 5.5 與現有模型處理相同素材,記錄提示長度、effort、計費輸出、快取、重試、完成時間與失敗原因;把門檻附近的長提示另外列出。先比較 medium,再視需要調整,別一次換模型、提示與驗收。

一般使用者可以先觀察自己哪些工作需要長篇脈絡、哪些只需短而固定的交付;開發者則應保存模型版本與路由收據。真正值得追蹤的下一個訊號,是不同團隊在固定設定下的窄任務成績,以及它們對每個合格成果算出的總成本。Claude Haiku 5.5 的意義,會落在這些能重複驗的工作裡。

接著閱讀

左右滑動查看更多推薦

今天先選一個有標準答案的小任務,留下一張成果與完整帳單的對照表。低價帶來的自由,是你能以更小的代價驗證更多工作;是否擴大使用,交給這張表回答。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。已訂閱?管理主題偏好(會寄登入連結到你的信箱)