跳到主要內容

【2026 最新】JevBench 教學:公開題怎麼重跑?封存題與四軸分數怎麼讀

最後更新: ·
JevBench 教學:公開題、封存題與四軸分數的判讀

看到 JevBench 榜單上兩個決策模型只差一分多,你會怎麼選?先別把分數當成百分制考卷。JevBench 教學真正要學的是:那個數字由哪些題目、哪套計分規則、哪台伺服器與哪種成本假設組成;自己重跑公開題後,又能說到哪一步。

這篇寫給第一次看模型榜單、也想照著指令檢查證據的人。你不必先懂機器學習;我會用客服退款的小故事,帶你看懂公開題與封存題、四軸分數,再給一份可複製的重跑與繁中保留題工作簿。本文以 2026 年 9 月 25 日查得的 JevBench v1.4.1 原始碼為準。這裡提供流程與判讀,不把未執行的模型請求寫成 AlphaLab 的實測結果。

先說結論:JevBench 是四張成績單,不是一個勝負字

一句話記住:榜單分數=指定題組 × 指定模型設定 × 指定計分版本 × 指定量測環境。少寫任何一項,就像比較兩人的跑步成績,卻不知道一個跑 100 公尺、一個跑 110 公尺。

  • 公開題可以讓你驗證輸入、輸出、錯題與基本統計;單靠公開題不能重建官方 v1.4.1 總分。
  • 官方分數同時看 Intelligence、Calibration、Speed、Cost;它不是「答對率 63%」。
  • 封存題只公開彙總。你能觀察公開與封存成績的落差,卻拿不到逐題答案來自行重跑。
  • 如果你的產品用繁中客服規則,就另留一小組自己未用於調參的繁中題;先比錯誤類型,再談排名。

JevBench 教學第一步:先知道它在測什麼

JevBench 是 Benchmark Heaven 製作的「有型別決策」評測,不是 TypeSafe AI 的官方產品測試。它把一份狀態、問題規則與有限選項交給模型,期待收到一個選擇,最好還有每個選項的機率。若你想先弄懂 Jev 為何只做決策,可讀 System One Model 與 Jev 白話解釋;這篇接著教你檢查評測。

想像客服規則是「30 天內且有收據才可退款」。顧客 12 天前購買,但拿不出收據。題目要模型在「可退/不可退」之間選一個;正解是不可退,因為兩個必要條件只滿足一個。專案公開資料就有這種原創政策題及其改寫句。若模型回答「不可退,機率 0.93」,你還要再問:它在類似題目上說 0.93 時,是否真的大致有 93% 正確?這就是「校準」,和單題答對是兩回事。

一題測試像一次路考:答對可加分,卻不足以證明任何道路都會開。JevBench 還有簡單題、標準題、判讀題和困難題;版本、題組及權重都會改變總分。v1.4 方法文件明列:舊題組共有 534 題,新增 308 題封存決策;其中可下載文字的公開題為 231 題。先分清「舊題組總數」與「你能拿到逐題文字的公開子集」,才不會把兩種口徑混成一個樣本數。

JevBench 教學第二步:拆開四軸與封存題

JevBench 教學四軸:判斷力、校準、速度與成本
四軸總分不是答對率;每一軸都回答不同問題。

把四軸當成買車時分開看的安全、油耗、速度與價格。單一總分方便初篩,但你不能用「總分比較高」取代自己的使用需求。

  1. Intelligence(判斷力):答對率先扣除隨機猜中的基準,再按題型與封存題混合。v1.4 的新封存題占這一軸的 20%;公開與封存準確率相差超過 25 個百分點,還會扣減這一軸。
  2. Calibration(信心是否可靠):不只看最高機率的答案,也看整組機率與參考分布是否相符。只回傳標籤而不給機率的系統,在這個維度的貢獻為零。
  3. Speed(速度):使用先前量測的延遲資料;發請求的網路路徑也算在內。自架與展示端點的部分延遲調整是作者的假設,不等於你所在地實際速度。
  4. Cost(成本):以每 1,000 次完整決策的估算美元成本計,不是每 1,000 個 token。公開費率與參考託管價格可能混用,讀數字前要先看成本基礎。

獨立研究者 June Kim 的可重跑稽核對 v1.2.7 公開困難題做了探針:即使回傳與參考機率完全一致,當時的校準計分仍可能扣分,因為「事件本身有多不確定」與「最高選項答對的信心」被放進同一個指標。這個觀察沒有重算現行 v1.4.1 名次;它提醒你讀 Calibration 時要先看公式和逐題例子,不能只看一個漂亮的軸分。

四軸各映射到 0–100 分,再用等權調和平均合成:某一軸特別低,總分會被明顯拉下。v1.4 還對低於 50 的判斷力、速度和成本軸各設平方懲罰。想核對公式,可以直接開 官方計分原始碼。這也說明為何官方總分不是答對率,更不能把舊版與新版榜單當作同一把尺。

JevBench 教學公開題與封存題:231 題公開,303 題舊組保留,308 題新增封存
公開可下載子集與封存題採不同可見範圍。

公開題像練習卷,封存題像考場新卷。官方公開逐題可重跑的 231 題;另外的題目與 v1.4 新增封存題在對外資料裡只給彙總。封存題要透過受測系統取得預測,若是模型提供者的 API,服務端仍會看到題目文字;「未公開答案」不能直接推成「從未被提供者看見」。作者在 封存題暴露說明用 API 標記記錄這件事。

JevBench 教學第三步:從公開題重跑一份可檢查的報告

以下是依儲存庫 README 與 CLI 原始碼整理的步驟。它會讓你在自己的電腦產生逐題紀錄;需有 Python 3.10 以上、Git,以及已獲准使用的模型 API 金鑰或自己控制的相容端點。先建立新的工作資料夾,把版本鎖住:

git clone https://github.com/fstandhartinger/jevbench.git
cd jevbench
git checkout v1.4.1
python3 -m jevbench.cli run --help

想先確認題目格式,可打開 datasets/public/original.jsonl 第一行。你會看到 state(狀態)、question(評分規則)、labels(允許的答案)、expected(參考答案)。先別把參考答案帶進模型請求。若你已有 TypeSafe API 使用權,於自己的終端機設定 TYPESAFE_API_KEY,再用官方 README 的參數跑一小段:

python3 -m jevbench.cli run --tasks datasets/public/original.jsonl --adapter typesafe --model jev-1.13.0 --key-env TYPESAFE_API_KEY --price-in-per-m 0.042 --price-out-per-m 0 --limit 12 --results RUN/results.jsonl --raw-dir RUN/raw --ledger RUN/ledger.jsonl --cap-usd 1 --manifest RUN/manifest.json

這行的 0.042 是 TypeSafe 模型文件於 2026 年 9 月 25 日列出的每百萬輸入 token 美元費率;jev-1.13.0 是固定版本,避免 jev-latest 別名日後移動。若改用另一模型或日期,先改成對應費率,否則成本欄只是錯誤假設。--limit 12 是練習流程,不足以比較模型。RUN/manifest.json 記下設定,RUN/results.jsonl 是逐題紀錄,RUN/raw 保存原始回應。正式測試時應建立新目錄,對每個候選用相同題目順序、明確的模型版本與相同選項順序。專案的 重跑範例另有不帶金鑰的公開端點寫法,但只能在端點確實允許你的使用方式時採用。

接著執行 python3 -m jevbench.cli summarize --tasks datasets/public/original.jsonl --results RUN/results.jsonl --public-export RUN/summary.json,讀 summary.json 的樣本數、答對率、格式有效率、Brier/ECE、延遲與成本基礎。先問「預計 12 題是否真的全部成功送出?」再看分數。CLI 遇到 401、403、429 或連續基礎設施錯誤會停止,未作答題不應算成模型答錯。這份摘要只描述你剛跑的公開子集,不是官方 842 題榜單的復刻。

自己做繁中保留題:用同一張工作簿判讀落差

若你的用途是繁中退款、醫療掛號或內部派單,英文測題的高分不會自動轉成你的工作品質。先從真實但已去識別的案例取 20–30 題作小型保留集;把題目、答案及理由先鎖定,再測候選模型。這個數量只是入門工作量,不是可宣稱模型全面勝出的統計保證。可把 AI Evals 七步入門當作建立保留集的補課。

  1. 固定題目。同時記錄繁中原句、容許選項、正解理由、業務風險與改寫版本;「先購買後補收據」和「收據遺失」應按規則標同一答案。
  2. 固定模型與環境。記錄模型完整版本、端點、日期、提示模板、選項順序、是否本機或遠端、硬體、併發數及網路位置;不要只寫「某開源模型」。
  3. 先對錯題,再對平均。把答錯分成漏看否定詞、規則條件、格式錯、過度自信、超時與拒答;優先處理會造成實際損失的類別。
  4. 保留乾淨的驗收題。若你看過題目再改提示、調閾值或選模型,那批題已成開發資料;另留未碰過的題才能檢查是否真的泛化。

最小工作簿可用六欄:task_id|scenario|gold|model_version|predicted|reason_for_error;另存一頁量測設定。若 A 在 25 題中對 22 題、B 對 21 題,先逐題看那兩套答案是否犯了不同錯,再補題;不能只憑「差一題」宣布 A 穩定優於 B。若你在做開源重製選型,可接著讀 Jev 開源重製潮,先分清開源的是介面、推論法還是權重。

榜單差一分時,先做這五個判讀

JevBench 教學官方 v1.4.1 快照:Jev 63.29 與 JevK5 62.04,分數不是答對率
官方 v1.4.1 榜單快照;名次只對應該版測試設定。
  1. 核對同版。2026 年 9 月 25 日 README 顯示 v1.4.1;v1.3 使用幾何平均,v1.4 改為調和平均且加入封存題。跨版分數不能直接相減。
  2. 拆四軸。截至同日官方頁面,前兩名分數如上圖。這是該版本、該設定的總分,不是每個應用場景的勝負。
  3. 看公開與封存落差。若公開題顯著好於封存題,先懷疑對公開題反覆調整的影響;但落差本身不證明某模型把題目拿去訓練。
  4. 讀成本註腳。有些欄位是公開費率乘實測 token,有些是同級硬體的託管參考估計;預算決策要改用你的帳單和每次完整決策成本。
  5. 換成你的任務。對高風險錯誤,先看判斷力和你保留題上的嚴重錯誤;對即時介面,還要在你的所在地量端到端延遲。可參照 三榜交叉判讀教學理解為何榜單各有量尺。

作者自己也在 方法限制提醒:封存題特別難,小幅差距不足以證明兩模型的成對優劣;部分速度調整仍沿用先前版本的假設。這些限制應放在比較那一刻,而不是讀完排行後才想起。

JevBench 常見問題:八個先回答的疑問

1. 公開題跑完就能複製官方總分嗎?

不能。你的公開題只有可下載子集;官方 v1.4.1 還用非公開逐題資料、封存題彙總、舊版速度與成本量測及指定合成公式。

2. 分數 63 就是 63% 答對嗎?

不是。那是四軸映射、調和平均及門檻調整後的指標;答對率要看單獨的 accuracy 欄及題型分布。

3. 封存題一定能防止資料污染嗎?

不能保證。方法文件只證明題文與答案沒有全部公開;受測 API 會接觸題文。封存題有助於檢查對公開題的過度適配,仍需持續更新。

4. 兩模型只差 1 分,可以直接宣布第一名比較強嗎?

不一定。先確認是否同一版本、同一計分設定,以及差距落在哪一軸;再用自己的保留題檢查重點錯誤。官方也提醒封存題的小差距不能當成已證明的成對優劣。

5. 模型只輸出「yes」,為什麼校準分低?

因為校準評的是機率。它需要每個候選答案的概率分布,才能檢查信心和實際結果是否相稱;只有標籤就缺這個訊號。

6. 可以拿其他榜單的分數來相減嗎?

不行。題目、輸出格式、權重與成本計算都可能不同。先問每個榜單測什麼,再看是否回答同一個使用問題。

7. 只測 12 題有用嗎?

有用於驗證流程,無法支撐排名。它能抓 API 權限、輸出格式與紀錄欄位;要比較品質,應增加符合你業務分布且未拿來調參的題目。

8. 新手第一件事該做什麼?

先讀一題,再看四軸。打開原創公開題、手判退款案例,對照模型逐題輸出;最後才看榜單名次與你的任務是否相符。

給新手的三個重點

  • 可重跑的是你拿到的題目、模型設定和流程;官方封存部分要讀作者公開的彙總與方法。
  • 總分是四軸取捨;先問錯誤代價,再看速度與成本,別把名次當需求文件。
  • 把繁中保留題留到最後驗收;一旦拿它調提示或選模型,就需要另一批新題。

結語:先重跑一題,再決定要不要信一分之差

JevBench 最有用的地方,是逼你把「模型好不好」拆成具體問題:它答對什麼題、信心準不準、你的網路要等多久、每次完整決策要花多少。今天就打開一行公開退款題,先自己判答案,再照上面的版本與紀錄欄位做一份小工作簿。當你能指出一分之差從哪裡來,也能說出哪些資料還沒量到,榜單才真正開始幫你做決策。想把評測流程接進日常工作,也可以從 AlphaLab 課程往下一步學。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。