跳到主要內容

Ox Alpha 深度解讀:95/95 GLM 指紋,63% 為何不是完整跑分?(2026)

最後更新: ·
Ox Alpha 95/95 GLM tokenizer 指紋仍不足以證明模型身分

2026 年 8 月 23 日,Marcus Schuler 在 The Implicator 發布〈Ox Alpha Matches Zhipu’s GLM Tokenizer in 95 of 95 Tests〉:這篇調查把 Ox Alpha 的 tokenizer、Z.ai 服務層線索、DeepSWE 跑分與匿名供應者串成一個完整故事。它抓對了最重要的身分線索,卻把「約 63%」誤寫成完整 113 題結果;這個錯誤會直接改變讀者對模型能力的判斷。

The Implicator 的 Ox Alpha 調查文章頁面,標題指出 95 次 tokenizer 測試全部吻合
The Implicator 的原文頁面;文章主張 95 次 tokenizer 測試全部吻合。圖/The Implicator;截圖於 2026 年 8 月 24 日,點圖可閱讀原文。

先把四種證據拆開,答案會清楚很多:平台流量只能證明被大量呼叫;benchmark 要看分母與設定;tokenizer 能辨識詞彙表血緣;錯誤訊息比較像服務層指紋。任何一條單獨拿出來,都不足以證明 Ox Alpha 就是某個確切 GLM checkpoint,更不能證明匿名供應者就是 Z.ai。

“A full 113-task community benchmark came in at roughly 63 percent.”

中文:一份完整 113 題的社群 benchmark,結果約為 63%。

The Implicator 原文

這句話是原文最關鍵、也最需要更正的地方:公開紀錄顯示,約 63% 來自一個未公開分母的較大子集;目前可逐題檢查的完整 113 題社群 run 是 66/113,也就是 58.4%。兩者不是同一份測試。

原文抓對了什麼:95/95 是強指紋,不是身分證

The Implicator 的核心依據來自 Joseph W. Elstner 的 tokenizer 指紋研究。他用多語言文字、程式碼與 Unicode 邊界字串建立 95 組 probes,再比對 Ox Alpha 回報的 prompt-token 數與公開模型詞彙表。加入 GLM‑5 詞彙表後,結果是 95/95 計數完全一致、平均絕對誤差為 0;另一組把 Ox、Z.ai 上的 GLM‑5.2 與本機 tokenizer 放在一起的測試,則有 25/29 一致,其餘四筆可由特殊字面量與輸入防護差異解釋。

這是比「問模型你是誰」或比較文風更扎實的黑箱證據。tokenizer 決定字串如何被切成 token,通常在訓練前就固定;要讓 95 組邊界案例全部碰巧相同,比讓兩個模型寫出相似答案困難得多。因此,Ox Alpha 使用 GLM‑5 世代的詞彙表/計數方案,已是合理且有公開測試支撐的判斷。

但指紋的解析度到此為止。Z.ai 在 Hugging Face 發布的 GLM‑5、GLM‑5.1 與 GLM‑5.2 三份官方 tokenizer.json 逐位元一致;Z.ai 也說 GLM‑5.3 沿用 GLM‑5.2 的 base model,差異來自 post-training。完美 tokenizer match 因而無法辨認 5、5.1、5.2 或 5.3,更無法辨認權重是否被微調、是否加上視覺 encoder,或背後由誰營運。

63% 的真正出處:較大子集,不是完整 113 題

把時間線排好,混淆就消失了。8 月 21 日,Ben Davis 先公開 10 題小測試:Ox Alpha 通過 8 題,得到 80%,而他在原貼就提醒「這是子集,真實分數可能有很大變異」。同日稍晚,DeepSWE 建立者 @winkey_h 回報約 63%,原文精確寫的是「on a DeepSWE subset」;貼文沒有公開題數、task IDs、traces 或完整設定。

8 月 22 日,Henry Zhang 才公開 完整 113 題 repository,canonical aggregate 是 66/113(58.4%)。Ben 隨後把約 63% 轉述成「Actual DeepSWE run … Ended at ~63%」,語意容易被讀成完整測試;約一小時後他又 更正執行者與範圍:那是 @winkey_h 的較大子集,不是完整 113 題。The Implicator 在更正貼文之後仍把兩條線合併,才留下「Ben 完成 113 題、約 63%」這個錯置敘述。

公開數字實際分母與證據可以怎麼解讀
80%Ben Davis:8/10,每題一個 Ox rollout;未附完整 traces 與固定環境探索性訊號,變異很大
約 63%Wenqi/Kevin:較大但未公布分母的 DeepSWE 子集比 10 題更有資訊,不能冒充完整 113 題
58.4%MatchaOnMuffins:66/113,公開 config、results 與逐題 artifacts目前最可稽核的完整社群 run,但不是官方 leaderboard 成績
三個百分比來自不同分母與可稽核程度,不能沿著 80% → 63% → 58.4% 當成同一條模型表現曲線。

58.4% 也需要邊界。該 run 使用 Pier 0.3.1、Docker、一次 rollout/task、90 分鐘 agent timeout;軌跡記錄解析到 mini-swe-agent 2.4.6。它與官方 DeepSWE 的 Modal 環境、約四次 rollouts/task、150 分鐘 timeout 及錯誤排除規則並不相同。更細看,社群 aggregate 有一題同時標記 timeout 與 reward=1;若依官方論文把 agent timeout 判為失敗,會變成 65/113(57.5%)。因此,66/113 是這份公開 artifact 的 canonical 結果,卻不宜直接換算成官方排名。

超過 11 兆 tokens:分發爆發,不是品質通過證明

OpenRouter 的 Ox Alpha 模型卡顯示七日滾動用量超過 11 兆 tokens
OpenRouter 模型目錄在 2026 年 8 月 24 日 06:23(台北時間)顯示 11.2T tokens;tooltip 定義為過去七日處理量,數值會隨時間與快取節點變動。圖/OpenRouter。

題目最初記錄的 4.63T 已經過時。截至 8 月 24 日清晨,OpenRouter 公開模型卡與資料端點顯示,Ox Alpha 的七日滾動用量已超過 11 兆 tokens。這是 input 與 output 的合計處理量,不是模型「生成」了 11 兆 tokens:同一時點的資料中,約 98.5% 是 prompt tokens,completion 約占 1.5%;cached-native tokens 又約等於 headline 合計的 85.8%。

所以這個數字最可靠的含義,是 Ox Alpha 在免費、百萬 context、Coding Agent 接入與神祕身分的條件下快速分發。它不能告訴我們有多少獨立使用者、多少輸入是重複 cache、patch 是否正確,也不能代替 benchmark。把平台流量當作能力分數,就像用網站 pageviews 判斷論文是否正確:能證明注意力,不能證明結論。

服務層很像 Z.ai,公開的 GLM‑5.3 卻不是同一個產品形態

研究者 Chetaslua 回報,透過 OpenCode 對 Ox Alpha 送出 malformed request 時,取得帶有 com.wd.paas.api.domain.v4.chat.ChatCompletionRequest Java class path 與 code 1214 的錯誤回應;Z.ai 的 官方錯誤碼表確實把 1214 定義為 invalid field。這項單次第三方觀察比輸出語氣更像服務層線索,可能指向共用 gateway、validator 或 serving code,仍未獲營運者確認。

它們仍不等於權重簽名。OpenRouter 把 Ox Alpha 標為文字、圖片、影片輸入,最多 1,048,576 tokens context 與 131,072 completion tokens;Z.ai 現行 GLM‑5.3 文件則列為文字輸入、1M context、128K output。Ox 可能是 GLM 家族衍生版、尚未公開的 preview SKU,也可能在語言模型前加上視覺 encoder/router。最節省假設的結論不是「已破解為 stock GLM‑5.3」,而是GLM‑5 詞彙表血緣很強,Z.ai 相容服務層也很可疑,確切 checkpoint 與 operator 仍未獲第一方確認

免費匿名預覽的真正代價:公開條款互相打架

OpenRouter 的 Ox Alpha 模型頁目前列出 input、output 都是每百萬 tokens 0 美元,並明載匿名供應者會保留 prompts 與 completions;同一頁同時說這些資料不會用於訓練。可是 2026 年 7 月 6 日更新的 Stealth Model Terms 又授權將 User Content 用於訓練、評估與改進;supplemental terms 頁目前未列 Ox Alpha,並說未列模型適用通用 EULA。第一方公開說明目前無法彼此完整對上。

因此,Ox Alpha 適合用公開 repository、合成任務與可重跑 eval 探索,不適合直接接上公司私有程式碼、API keys、客戶資料或未發表設計。這不是因為已證明供應者會濫用資料,而是因為 route 會保留內容,讀者也無法從目前兩份互相衝突的公開說明確定資料用途邊界。OpenRouter 的 EULA 只把它定位成可隨時移除的限時預覽,因此也不能把目前的 0 美元價格外推成長期承諾。

AlphaLab 判斷:謎底還沒揭開,證據已足以改變用法

  • 原文最有價值的結論成立。95/95 tokenizer match 讓 GLM‑5 家族血緣從猜測升級為強而可重查的證據;但共用 tokenizer 跨越多個 GLM 版本,不能辨認確切 SKU、權重或營運者。
  • 原文最關鍵的 benchmark 敘述不成立。約 63% 是未揭露分母的較大子集;完整 113 題公開 run 是 66/113(58.4%),而且仍受 harness 與 timeout 規則限制。
  • 超過 11 兆 tokens 證明 Ox Alpha 成為分發現象。七日流量的絕大部分是 input,且大量命中 cache;它是需求與 Agent 工作負載的訊號,不是品質或獨立使用者數。
  • 服務層線索比自我介紹可靠,仍只能定位到家族與基礎設施。相同 tokenizer、Java class path 與 1214 error envelope 能由衍生模型、代理 gateway 或多模態 composite 一起解釋,沒有必要先跳到「就是 stock GLM‑5.3」。

接下來真正值得追的不是更多「你是誰」截圖,而是三個可對帳事件:匿名供應者是否由第一方揭露、OpenRouter 是否統一 retention/training 條款,以及獨立團隊能否在固定 task commit、相同 harness、相同 rollouts 與 timeout 下重現完整結果。在這三項證據到位前,Ox Alpha 最準確的定位就是:高使用量、GLM 血緣證據很強,但身分、條款與可比較能力仍未結案的匿名預覽

接著閱讀

左右滑動查看更多推薦

若要親自測 Ox Alpha,先選一組無機密、可驗證的公開任務,固定 route、reasoning effort、timeout 與重試規則,保存完整 trajectory;這比再追一個沒有分母的百分比,更接近真正可用的答案。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。