你看見 Cloudflare 的 Clef 跑分,也看到有人說 Jev 在自己的工單上更快。現在要處理一批繁體中文客服訊息:Clef vs Jev 到底該選誰?若把不同機房、不同題目和不同輸入長度混在一起,測到的可能只是環境差異。
這篇寫給第一次比較決策模型、但願意照著工作表和少量程式操作的讀者。我們用同一份繁中分類題、選單外問題和收據圖片,帶你從題目設計走到選型;文中的案例與記分表是待執行的測試設計,不是 AlphaLab 已測得的成績。
先說結論:Clef vs Jev 先比工作,再比榜單
一句話記住:模型選型=同題同條件的品質 × 可接受的延遲 × 完整成本。把三位應徵者交給同一份考卷,才能比較誰適合你的職位。對文字分流,Clef、Clef-flash、Jev 都要答同一批題;對原生圖片題,應另開一組,不能把 Jev 的文字題和 Clef 的圖片題硬算進同一個總分。
截至 2026 年 10 月 3 日,Cloudflare 的 Clef 模型頁與Clef-flash 模型頁列出兩者的視覺輸入、65,536 token 上限及每百萬輸入 token 的標價;同平台 Jev 模型頁列出 32,000 token 與其標價。這些是規格與價格,不是你工作流的準確率或端到端速度。

Clef vs Jev 比的是什麼?先拆開三種輸出
決策模型像一位只能在你提供的選單上打勾的助理。你給它 state(這次要判斷的資料)與 questions(問題及允許答案),它回傳選項和機率;實際送往哪個部門、何時轉人工,仍由你的程式或工作規則決定。Clef 官方模型卡把它描述成對 schema 選項直接評分,而非先寫一段自由文字再解析。
- Choice:從「帳務/技術/其他」選主責部門。
other要有清楚定義,並用真正的選單外題目檢查它是否有用。 - Noul:回答「是否急迫」的機率。0.8 是模型輸出,不是你這批繁中案件已被證明八成正確。
- Score:回答有順序的等級,例如一般、優先、立即;比較時要保留完整分布,不只抄一個平均分。
Clef 和 Clef-flash 的託管文件另列出 images 欄位,可放嵌入式 PNG、JPEG 或 WebP;Cloudflare 的 Jev 頁則示範文字與結構化 state。這讓「讀圖片」成為要單獨驗收的工作能力。圖片能送入模型,不等於繁中字據、模糊收據或遮蔽欄位一定看得對。
五步建立可重跑的繁中盲測
① 先寫好標準答案,再把模型名稱藏起來
準備三類資料:明確的主責題,例如「發票被重複扣款」→帳務;容易混淆的雙主題題,例如「退款後還是無法登入」→依你的流程定義主責;選單外題,例如「想應徵工作」→其他或人工。每題留下 id、原文、預期部門、是否應棄權、標註理由。標註者先各自判,再討論分歧;若人也無法一致,先改標籤規則,不要把模型當裁判。
可以從十來道公開、合成的繁中句子起步檢查流程,再擴充到有代表性的保留集。起步小樣本只能找錯誤類型,不能當可靠的整體準確率。把地區用語、錯字、否定句與長短訊息分層;每層的題目數、版本和標準答案都要留下。Jev 標籤與棄權教學可接著幫你把 other 的邊界寫清楚。
② 凍結同一份 Choice 題幹與選項
同一道題的 state、instructions、criteria 和選項順序都固定,只換模型識別碼。例題:state="我的電子發票被扣兩次,請查退款";criteria={"billing":"扣款、發票、退款","technical":"登入或系統故障","other":"不屬於前兩類"}。請記錄實際送出的 JSON 和回應中的具體模型版本。Cloudflare 的Clef 呼叫範例與Jev 呼叫範例都展示了這個基本形狀,但各託管入口的外層封裝不同。
③ 在同一平台、同一地區交錯跑多次
三個模型可經 Cloudflare Workers AI 比較:同一個 Worker、同一份資料、相同的記錄程式,依題目輪換先後次序。每題先暖機,再至少重複數次,分別記 開始送出→收到完整回應 的毫秒數、HTTP 狀態、重試次數、回傳模型名與 token 使用量。若只拿供應商的「模型推論延遲」對比自己的網路往返,就像拿廚房出餐秒數對比外送抵達時間。
用 Cloudflare Worker 時,三個模型名稱分別是 @cf/cloudflare/clef、@cf/cloudflare/clef-flash、typesafe/jev;前兩者的 payload 需帶對應的 model 值。可按官方頁面的 env.AI.run(模型名稱, payload) 範例做第一題,再把資料列與計時器接上。這段是接口路線,並非已經替你部署好的跑分器。

④ 文字、未知類別與圖片分開驗收
文字題至少算三種結果:主責是否正確、該棄權時是否轉人工、是否發生截斷或 API 錯誤。未知類別不能只看 other 的最高分:要看錯誤自動派單造成多少返工。截斷可設「答案資訊放在結尾」的對照題,但先確認實際 token 長度、服務端回傳與輸入限制;不能僅憑某一次答錯判定被截斷。
圖片題另做小組:自製兩張無個資的繁中收據與一張模糊反例,事先標好「金額是否可辨識」「應交人工嗎」。按照Clef 文件的圖片限制送嵌入式檔案,不用遠端 URL。若流程目前把影像先 OCR 成文字,應把「OCR+Jev」當成一條完整管線,包含 OCR 的時間與費用;它和「原圖+Clef」比的是成品流程,不能只比模型核心。
⑤ 把價格換成每一張完成的單
截至 2026 年 10 月 3 日,Cloudflare 託管頁列 Clef、Clef-flash、Jev 每百萬輸入 token 分別為 US$0.24、US$0.09、US$0.042。這只能算文字輸入的標價起點;實際每題成本要按各模型回應的用量、你的重試與前處理計,圖片題還要核對計費方式。用 總帳單 ÷ 成功且正確完成的題數 比單次標價更貼近業務成本。
請另外保存 p50 和 p95 延遲。p50 告訴你一般題的感受,p95 告訴你慢的那一尾會不會拖住客服流程。若兩個模型品質接近,就看哪個在你的可接受延遲與返工成本內;若品質差距明顯,單看 token 單價會選錯。
官方跑分與外部報告,要放在正確位置
Cloudflare 在Clef 發布文公開自己的 Decision Index 與延遲數字,其中一些題目 Clef 較高,另有題目 Jev 較高。這是供應商在指定資料、配置與時間的自報結果。另一份DecideBench 原始資料與方法提供不同題集及測試紀錄;它用英文題、經 AI Space gateway 測託管模型,並明列標註與地域限制。這兩組數字不能相減得出繁中客服結論。
Reddit 上也有使用者描述自己的呼叫與延遲差異,貼文公開的是個人觀察。本文只把它用來設計「截斷/延遲」檢查題;勝負仍要由完整、可重跑的同題資料決定。
Clef vs Jev 怎麼選?看你的那條工作流程

- 只有文字分流:先讓三者用同一批繁中保留題應考。若 Jev 達到你的錯誤與 p95 門檻,現有流程不用因榜單而搬家。
- 需要直接看收據圖片:先驗 Clef/Clef-flash 的原圖流程,再拿「OCR+文字模型」整條管線比較。
- 延遲敏感:優先比較 Clef-flash 與 Jev 的同區域 p95,並確認棄權與返工沒有抵消省下的毫秒。
- 重大動作:保留人工覆核與可回退規則;模型分數只是觸發條件之一。
最實用的決策樹是:工作是否含圖片?→ 文字題誰的錯誤成本較低?→ p95 是否過關?→ 每件正確完成成本是否可接受?若某模型在「其他」題硬塞既有類,就先調整選單與轉人工門檻,再重跑保留題;不要把測試集同時拿來調參和宣告勝利。
常見問題:八個容易誤判的地方
1. Clef 一定比 Jev 好嗎?
不一定。截至 2026 年 10 月 3 日,公開比較涉及不同題集、部署路徑與版本;你的繁中工作資料仍要自己驗收。
2. Clef-flash 一定是最快的嗎?
不一定。官方內部延遲與你所在區域的端到端 p95 是兩個量;網路、排隊、重試都會改變答案。
3. 有 65,536 token 規格就不會截斷嗎?
不能這樣推。Cloudflare 文件明說過長 state 會截斷以符合模型限制;用接近上限且關鍵句放末尾的題目,記下實際輸入與回應。
4. 機率 0.9 就是九成正確嗎?
不是。要先在獨立保留集看相同分數帶的真實正確率,才能談這批資料的校準。
5. 其他類別就是安全棄權嗎?
不是。other 是模型可選的一格;它是否擋住未知類別,需要以選單外題和人工覆核率驗證。
6. Jev 和 Clef 的圖片分數能直接排成一列嗎?
不應直接混算。原圖與 OCR 文字是兩種管線;要比較就把 OCR 的品質、時間與成本一併納入。
7. 十題示範夠選模型嗎?
不夠。十題適合驗操作和發現錯題類型;正式選型需要覆蓋實際比例、罕見錯誤及你承受不起的情境。
8. 該先挑最低標價嗎?
先算完成成本。單題便宜若造成較多錯派、重試與人工返工,總成本仍可能更高。
給新手的三個重點
- 把比較單位固定為同一張繁中工單與同一份答案規則。
- 文字、未知類別、圖片各有自己的分數;錯誤與棄權同時記。
- 先用自己的保留題決定模型,再把供應商與外部榜單當成背景線索。
接著閱讀
左右滑動查看更多推薦
下一步:先做一份不寫勝負的考卷
今晚先開一張工作表,寫下十則不含個資的繁中訊息、每則的標準主責與是否應轉人工。請同事先盲標,再凍結選項;之後才按官方 Clef API 範例送出第一題。當三個模型都留下完整請求、回應、錯題、p95 和帳單,你就有自己的答案。若想把這種驗收方法用在更完整的 AI 工作流,可接著讀Agent Harness 入門、Agent Harness 實作,或到AlphaLab 課程挑一條練習路線。
