你有一批客服訊息,想用 Jev 分類標籤把它們分給「帳務」「物流」等窗口;翻開資料才發現,有人同時問退款和包裹,有人提出從未見過的新問題。選項還沒定,該怎麼開始?
這篇寫給第一次替 AI 分類流程設計資料的讀者。你會用一份小樣本,先找出候選類別,再把標籤、例外和人工複核寫成可檢查的規則;最後學會公平比較 Jev、傳統分類器和人工標註。不必先懂機器學習,也能自己做一張驗收表。
先說結論:先開放探索,再封閉決策
一句話記住:探索候選標籤 → 人工固定 Choice → 用保留題測錯誤與棄權。把它想成開餐廳:試營運時先記錄客人怎麼點餐;正式出單時才印固定菜單;菜單上找不到的需求,交給店員處理。
Jev 的 Choice 官方文件把 Choice 定義為「從事先列出的選項選一個」,並回傳各選項機率與 confidence。它適合吃下已定義的選項;選項怎麼命名、是否涵蓋真實問題,仍要由流程設計者驗收。若你只想先弄懂 State、Choice、Score、Noul 的差別,可先讀 System One Model 與 Jev 入門。

Jev 分類標籤為何要先探索?三種問題別混在一起
- 還不知道有哪些類:例如客服資料裡冒出「修改訂閱方案」。此時要看原始訊息、整理候選標籤,再決定它是否值得成為新類。
- 知道類別,卻有重疊:「退款還沒到,包裹也沒到」同時碰到帳務與物流。要先說清楚你是在選唯一主責窗口,還是要貼多個主題標籤。
- 類別清楚,個案仍不明:「上次那件事幫我處理」資訊不足。即使菜單完整,也應留下詢問或人工複核的出口。
這三種情況會導向不同的行動:新增或合併標籤、改寫邊界、或要求更多資訊。把它們都當成「模型低分」會讓你修錯地方。
5 步建立 Jev 分類標籤與棄權流程
第 1 步:先決定「一張單選一隊」還是「一張單貼多標籤」
痛點是同一則訊息可能談兩件事。先寫下本次輸出的用途:若系統只能指派一個主責窗口,就用一個 Choice 問「誰先接手」;若要記錄多個主題,則把主責 Choice 與額外的主題判斷分開。官方 Choice 範例也展示:一個問題選主責隊伍,其他問題各自回答,後續由程式決定哪些答案有用。
在工作表第一行填入 任務=選一個主責隊伍,旁邊再填 次要標籤=可複數,暫不自動執行。這一步的可觀察結果,是兩位標註者讀到同一張單時,知道自己是在選「主責」還是列出「所有提到的主題」。
第 2 步:拿原始小樣本提名,而不是直接把提名上線
從不同日期、語氣、語言及來源抽一批訊息;可以先用 20 筆做標籤草圖,這個數字只是起步工作量,不能當成準確率樣本。讓兩位熟悉業務的人各自寫「可能的主責、次要主題、不知道原因」,也可讓生成式 LLM 提名候選名稱,但每一個名稱仍要回到原文逐筆核對。
把「退款」「退費」「錢何時回來」先放到同一候選群,再檢查它們是否真的指同一處理流程。候選群旁要留原句與反例;不要只存模型產生的標籤字串。這是開放探索階段,產物是待審的標籤草案,還不是 Jev 的正式 Choice。
第 3 步:為每個選項寫邊界,保留「其他」與人工複核
假設最後保留 billing、shipping、account、other。不要只寫四個短字:billing 是扣款、退款、發票;shipping 是配送進度、遺失或地址;account 是登入與帳號設定;other 是前三者均不符合的主要需求。每一項再補一則「相似但不屬於我」的反例。
官方 Choice 文件建議,選項可能涵蓋不全時加入 other 或 none of the above。但 other 只是候選答案,不等於已證明模型能抓到未知類;要在測試集刻意放進選單外案例,才知道它會選 other,還是硬塞到既有類。
第 4 步:凍結 Choice 版本,先用一則假資料驗 API 形狀
截至 2026 年 9 月,官方 HTTP API 參考記載端點為 POST https://api.typesafe.ai/v1/systemone,請求包含 state、model、questions,Choice 選項放在 criteria 映射中。以下是可複製的最小請求;先依官方 Quick start建立自己的 API key,將它存在環境變數 TYPESAFE_API_KEY,不要貼進工作表。
curl -X POST https://api.typesafe.ai/v1/systemone \
-H "Authorization: Bearer $TYPESAFE_API_KEY" \
-H "Content-Type: application/json" \
-d '{"state":"我的包裹三天還沒到,想查配送進度","model":"jev-latest","questions":{"primary_team":{"type":"choice","instructions":"這張客服單應由哪一隊先接手?只根據主要需求選一隊。","criteria":{"billing":"扣款、退款或發票;不是配送進度","shipping":"配送進度、遺失或地址;不是退款處理","account":"登入或帳號設定","other":"前三隊都不符合的主要需求"}}}}'
把這份 criteria 存成 taxonomy-v1,連同模型回傳的實際版本、輸入、完整機率分布和人工覆核結果一起記錄。jev-latest 是官方文件的模型別名;比較不同時間的結果時,應保存回應中的具體 model 值。若請求出錯,先照官方 API 回應欄位檢查授權與 JSON,不要把錯誤回應當成「模型棄權」。
第 5 步:用保留測試集選門檻,不拿示例數字充成成績
另留一批從未參與標籤命名與門檻調整的訊息,請人先標「標準主責」「是否選單外」「是否需要追問」。至少放進四種壓力題:清楚的已知類、兩類交界、資訊不足、故意被拿掉的有效新類。最後一種是最直接的未知類壓力測試。
應用程式先檢查回應是否合法;接著若 choice=other,或所選選項的機率未達你在開發集挑出的門檻,就把單轉給人工。這裡的棄權是你的程式路由規則,不是 Jev 自己多生一個新標籤。官方 Choice 一致性 cookbook示範了用最高選項機率設「不確定」出口,同時提醒示例門檻不是準確率保證。
一張工單走完流程:退款、物流,還是需要追問?
以下是教學用虛構案例,只示範流程,不是 API 輸出紀錄。訊息:「包裹還沒到,而且上次的退款也沒收到。」探索階段會記下「物流+退款」兩個主題;標籤規則若要求選唯一主責,人工要先決定以哪一個問題先處理,或把它標成需追問。
固定 Choice 之後,Jev 只會從你提供的主責選項選一個,並附每個選項的機率。假如它偏向 shipping,程式仍要按事先寫好的門檻判斷是否放行;若進人工佇列,標註者記下「邊界模糊」而非逕自新增類。若同類案例反覆出現,再回到第 2、3 步討論是否改分類規則,並發布 taxonomy-v2。
這個例子也說明為什麼選項機率不是「答案正確率」。官方 confidence 說明指出,confidence 是機率分布集中程度的摘要;要知道某類是否真的判對,必須與獨立人工標準答案比對。
怎麼比較 Jev、傳統分類器與人工標註?
公平比較的單位是同一批訊息、同一份標籤定義、同一個保留測試集。傳統分類器只用訓練集的人工標籤學習;Jev 收到相同的選項定義;人工標註者不看任何模型的答案。把調門檻用的開發集與最後報告的測試集分開,避免挑到只對這批題目好看的規則。這和 AI Evals 新手教學的「先定成功條件,再跑未見案例」是同一條線。
- 自動放行錯誤率:
自動放行且分錯的筆數 ÷ 自動放行筆數。如果一筆都沒放行,這項記為不適用,不能寫 0%。 - 棄權率:
送人工筆數 ÷ 全部筆數;同時報放行覆蓋率,才看得出模型是否靠全部棄權換來低錯誤。 - 未知類攔截:
選單外案例中被送人工的筆數 ÷ 選單外案例總數,另列被硬塞進舊類的原句。 - 標註一致性與時間:同一規則讓兩位標註者獨立標,記分歧與複核時間;人工也會不一致,不能把一人的第一眼判斷當絕對真值。
如果要把這四條做成實際的對照圖,等你跑出真實結果後,再按「每種門檻一個點」畫錯誤與棄權率。本文沒有替 Jev、分類器或人工標註報出實測勝負。看模型榜單時,也要分清公開題、封存題和評分軸;可接著讀 JevBench 教學。
上線前的 4 個坑:標籤會變,門檻也會失效
- 把多標籤問題硬改成單選:先寫清楚主責隊伍的決策用途;次要主題另記,不要把同一張單的兩個真實問題當成模型錯誤。
- 以為
other自動抓未知類:刻意從選單拿掉一個真實類別,檢查它是進 other/人工,還是流入舊類。 - 用一個漂亮門檻吃遍所有風險:只是顯示分類建議與直接觸發退款的後果不同。官方 信心門檻指引也要求按行動風險設門檻;高風險動作應另外經授權與人工確認。
- 標籤改名後沿用舊成績:每次改
criteria、加入新類或改主責定義,都保存版本並重跑保留題。TypeSafe 的 Jev 1.13 限制說明提醒,冗長干擾資訊與繞彎的問題表述都可能傷害判斷。其 模型文件也明說英文表現目前最佳,包含繁中在內的 CJK 語言表現不等同英文;繁中題庫務必單獨驗收。
如果你想比較本機單 Token 決策與 Jev 的雲端 Choice,先把同一份題庫和棄權定義拿去跑 NotJev 本機棄權教學;比較時保留各自的 API 回應與運作條件。
常見問題:Jev 分類標籤怎麼定?
1. 完全不知道標籤,能直接把原始資料丟進 Choice 嗎?
先做探索。 Choice 的答案空間要由你提供;先從原文歸納候選,再由業務人員審查與命名。
2. 官方 autoresearch cookbook 是自動找分類標籤嗎?
它示範的是另一件事。 官方範例讓 LLM 提出 TypeSafe 問題,把文字轉成特徵,再用已標註的葡萄酒評分訓練 CatBoost;不能把它的結果直接解讀成從無標籤資料自動產生客服分類法。
3. 加了 other,就能放心處理所有新類嗎?
不能直接這樣推論。 other 是你設計的選項;要用被刻意留出清單的類別測它是否真被送去人工。
4. confidence 低就一定判錯嗎?
不一定。 它描述輸出分布的集中程度;正確與否仍需對照保留題的人工標準答案。
5. 一則訊息有兩個主題怎麼辦?
先定輸出任務。 若只需一個主責,規則先指定優先順序;若要多個主題,就另做多個判斷,並由程式整合。
6. 可以把 Jev 機率直接當退款許可嗎?
不要直接連到不可逆動作。 分類可以提供路由訊號;付款、退款或封鎖仍須經業務規則、授權和必要的人工作業。
7. 20 筆樣本夠驗準確率嗎?
不夠據此宣稱穩定表現。 20 筆只適合試做標籤草圖;正式驗收要另外保留不同時段、來源與選單外案例,並報告樣本數。
8. 什麼時候改用傳統分類器?
把它當正式對照組。 若已有穩定標籤和足夠人工資料,就在相同測試集上比較錯誤、棄權、延遲與維護成本,再決定部署方式。
給新手的 3 個重點
- 先發現:從真實原句和反例整理標籤,不要把 LLM 提名當真值。
- 再固定:寫清楚 Choice 的用途、每個類的邊界與 other,版本化後再進入推論。
- 最後棄權:以保留題選門檻,並把錯誤率、未知類攔截和人工量一起看。
接著閱讀
左右滑動查看更多推薦
結語:今天先做一張標籤邊界表
先從手邊 20 則真實訊息開始:每則留下原文、候選主責、次要主題和不確定原因;再寫出四個選項的定義與反例。等兩位標註者能用同一套規則處理交界案例,再把版本固定成 Choice,留出新題測錯誤與棄權。先發現、再固定、最後棄權,這就是把 Jev 從漂亮示例接進可驗收流程的起點。若要繼續學系統如何接工具、記錄與回歸測試,可看 Agent Harness 實作教學與 AlphaLab 課程。






