Jev 開源重製潮來得比模型評測還快。2026 年 9 月 15 日,TypeSafe 創辦人 Diogo Almeida 在官方部落格發布〈Introducing System One Models & Jev〉;GitHub 的 UTC 記錄顯示,SemIf 倉庫建立於 9 月 16 日,Laya 倉庫與 Hugging Face 權重則在 9 月 18 日出現。在這三個日期標籤間,開源社群已做出瀏覽器本機決策介面與一個 421M 參數的專用模型。真正要問的不是「Jev 是否已被破解」,而是:大家重製的究竟是模型、介面,還是只是一個早已存在的分類技巧?

這篇文章不再重寫 Jev 的完整入門;那部分可先看 AlphaLab 的《Jev AI 把判斷變成軟體原語》。本文只做三件事:先界定什麼才算「重製」,再核對 SemIf 與 Laya 公開了哪些可檢查的產物,最後判斷這波速度究竟讓 Jev 的護城河變薄,還是只證明決策介面很容易模仿。
Jev 開源重製潮,先從「被重製的是什麼」談起
Jev 的產品主張可以拆成三層。第一層是輸出契約:開發者先定義 Choice、Score、Noul 等問題與可接受答案,模型回傳值和機率。第二層是運算路徑:不逐字生成答案,而是一次讀出多個決策。第三層才是模型本身:訓練資料、目標函數、權重、服務系統與校準方法共同決定品質。
Think of Jev as a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out.
中文:把 Jev 想成一次具備前沿智慧的函式呼叫——輸入未結構化狀態,輸出有型別、帶機率的決策。
Diogo Almeida,TypeSafe
這句話把產品形狀說得很準,卻也說明為什麼「看起來像 Jev」不等於「重製了 Jev」。只要把開放模型最後一層對選項的分數正規化,或微調一個分類頭,就能做出同樣形狀的 API;要證明模型能力等價,還必須在同一資料、同一標註、同一延遲口徑下比較正確率、校準與失敗案例。
SemIf:重製介面,而且主動說沒有重製 Jev
SemIf 最初名為 OpenJev。它用 Qwen3、MiniCPM5 與 Qwen3.5 等開放模型,直接讀取允許選項的 logits,再把分數正規化成機率;瀏覽器版本設計成透過 WebGPU 在本機載入權重,專案頁稱推論不經後端。這確實重現了「狀態+問題+選項 → typed probabilities」的操作感,但作者在 README 裡把界線寫得非常清楚。
This project reproduces that interface pattern with open models; it does not reproduce Jev’s undisclosed model or training.
中文:這個專案用開放模型重現的是介面模式;它沒有重製 Jev 未公開的模型或訓練。
SemIf README

SemIf 最有價值的不是宣傳語,而是它把 runner、固定模型 revision、原始輸出與已知失敗都放進倉庫。作者用同一個 Qwen3.5-4B、同一張 RTX 3090、同一份狀態與 21 個二元判斷,比較兩條輸出路徑:直接讀取 logits 的三次中位數是 1.023 秒,逐 token 寫出精簡 JSON 陣列是 5.332 秒。這支持「省掉生成迴圈可以更快」,但兩條路徑只有 18/21 個 argmax 相同;它們連語意輸出都不完全等價,因此 5.21 倍不能解讀成同品質下的純加速。
品質比較也同樣有限。SemIf 在能從 TypeSafe 公開材料對齊的 102 列子集上,報告 Qwen3.5-4B 的 modal agreement 為 0.845,Jev 的發布值為 0.883;專案作者明示自己沒有呼叫 Jev live endpoint,而且這 102 列不是 TypeSafe 自報的 711 列完整彙總。換句話說,SemIf 已是可重現的開放基準線,不是 Jev 等價品。
Laya:權重是真的,但「勝過 Jev」不是公平比較
Laya 的 Hugging Face 模型頁比 SemIf 再往前一步:它不只提供介面與 runner,也提供模型權重、ModernBERT encoder 設定、推論程式與評測 JSON;Hugging Face metadata 記錄 421,293,830 個參數。作者在公開結果檔中報告,單一問題 p50 為 38.4 毫秒、p95 為 42.1 毫秒。這些檔案證明可下載的模型產物確實存在;速度仍是作者環境的自報結果,而且該結果檔沒有列出 benchmark hardware,本文也沒有重跑。
但程式碼也揭露一個重要差別:Laya 會替每個問題各建一條完整的「state+question」序列,再把多條序列批次送進同一次模型呼叫。這是 batched forward call,但每題仍重複編碼 state;因此它沒有重現 TypeSafe 對同一 state 多題平行處理所宣稱的效率,也不能讓我們推知 Jev 未公開 sampler 的內部做法。Laya 的自報 p50 也從單題 38.4 毫秒,增加到 10 題 156.0 毫秒、50 題 721.4 毫秒。
更大的問題出在比較表。Laya README 把自己的 83.8% in-task macro accuracy 放在 TypeSafe 的 67.8% 四工作流彙總旁邊,並宣稱高出 16 個百分點;但 Laya 同一模型頁的 results.md 把 in-task overall accuracy 列為 0.753,依 JSON 的 13 個 task family 做簡單平均則約為 0.779。公開產物內部就沒有對齊 0.838;兩邊又不是同一資料集、標註方法或任務分布。把它與 Jev 的數字相減,不能構成 head-to-head benchmark。

更值得看的反而是 Laya 自己留下的反例。它把四個完全未參與訓練的 task family 各測 600 題,總計 2,400 題;公開結果顯示整體 accuracy 為 0.651、ECE 為 0.204,明顯弱於訓練內分布的結果。這不代表 Laya 沒用,而是直接否定了「模型輸出一個機率,任何新場景就都能依那個機率安全自動化」的跳躍。模型頁也把輸入長度設為 512 tokens;真實工作流是否容得下,仍要逐案測量。
一個 forward pass 不是新發明,新的可能是產品契約
從研究史看,BERT 在 2018 年就示範用 encoder 加一層輸出頭完成分類;把任務轉成 natural-language inference 的零樣本文本分類也早於 Jev。因而,「不生成句子、一次輸出類別分數」本身並不是 Jev 才出現的科學概念。
Jev 真正有辨識度的,是把 runtime-defined questions、型別約束、共享狀態下的平行判斷、機率與低延遲服務包成一份開發者契約。SemIf 證明其中相當一部分能疊在現成開放模型上;Laya 則證明社群能快速訓練一個專用 checkpoint。這正是本次 Jev 開源重製潮最重要的訊號:介面形狀很可能快速商品化,模型品質卻不會因此自動等價。
型別正確,仍然可能很有自信地選錯

TypeSafe 的發布文使用「can’t hallucinate」這個強烈說法,但同一段也註明圖中的 Jev 0% 並非 empirical measurement,而是 schema matching 的保證。精確解讀是:模型不會回傳型別之外的字串,卻仍可能在合法選項中選錯。SemIf 也提醒,它回傳的機率只是在給定選項之間的條件分布,必須在實際工作負載上重新校準與驗證。
這條界線決定一個決策模型能否進入生產。格式正確率可以由介面保證;語意正確率要靠標註測試集;機率是否可信還要看 reliability diagram、ECE、Brier score 與 distribution shift。把三者混成一個「不會幻覺」承諾,會讓系統在最危險的地方產生錯誤安全感。
AlphaLab 判斷:護城河從介面退到資料、校準與服務
我同意樂觀派的一半。SemIf 和 Laya 出現得如此快,說明「typed probability output」已不再只有 TypeSafe 一種公開實作。開放模型、瀏覽器推論與專用 encoder 都已做出可運行、可檢查的版本;對路由、內容分級、工單分類等窄任務而言,這也建立了不必每次生成完整文字的替代路徑。
我不同意另一半。截至 2026 年 9 月 19 日,本文核對的兩個倉庫與模型頁能支持的是:SemIf 重製介面模式,Laya 提供自己的 checkpoint;Laya 的跨資料集比較不能當勝負,SemIf 也把自己定位成 interface baseline。若 TypeSafe 仍有難複製的優勢,更可能落在高品質任務資料、跨分布校準、共享狀態的服務效率、監控與長期 failure handling。這些恰好也是發布日最難從漂亮 demo 判斷的部分。
因此,這場 Jev 開源重製潮比較像一次價格發現:它把「直接讀決策機率」從神祕新類別,壓回可自行建造、可替換的工程元件;同時也把 TypeSafe 必須證明的價值抬高——不是輸出長得像什麼,而是機率在陌生資料上是否仍值得信任。
現在要試,請用同一把尺量四件事
- 鎖定一個低風險、可回放的窄任務。先做工單分流、內容標記或模型路由,不要直接批准付款、停權或醫療處置。
- 固定輸入、選項與保留測試集。規則引擎、傳統分類器、structured-output LLM、SemIf、Laya 與 Jev 必須回答同一批題目;不同資料集的百分比不要相減。
- 拆開四種指標。任務 accuracy、機率校準、端到端 p50/p95 延遲、完整運行成本分別計算;schema success 另列,不能代替正確性。
- 先畫 risk-coverage 再定自動化門檻。確認模型在資料漂移、長輸入、罕見類別和 prompt injection 下何時應升級人工,並保留一鍵停用與回放紀錄。
若你要把這套比較變成可持續的測試流程,可接著讀 AlphaLab 的《AI Evals 是什麼?從指標到持續評測完整教學》。真正有意義的下一輪競賽,不是誰最早貼出 35 毫秒,而是誰能公開同資料、同口徑、可重跑的 accuracy—calibration—latency 三角形。
接著閱讀
左右滑動查看更多推薦
最值得做的下一步:選一個你已有人工作答紀錄的小決策,固定 200 筆保留樣本,讓 Jev 與兩個開放基準線在相同條件下跑一次;先比較校準與錯誤分布,再談誰比較快。






