2026 年 8 月 23 日,記者 Duncan Riley 在 SiliconANGLE 發布了〈Nobody knows who built AI coding model Ox Alpha or where the code goes〉,把 Ox Alpha 最值得追問的矛盾放到桌面上:一個作者與營運方未對外公開的免費 coding model,在短短幾天內吸走龐大 agent 工作量,但使用者仍無法確認程式碼究竟交給哪個上游法律實體,而公開的 training 文案又互相衝突。
原文同時追了三條線:早期 benchmark 為何迅速降溫、黑箱指紋能否指向 GLM 家族,以及 OpenRouter 與 OpenCode 的資料承諾為何不同。本文把這些線索更新到 2026 年 8 月 26 日,並拆開一個更關鍵的問題:37 兆 Token 證明了驚人的分發與採用,卻還不能證明 Ox Alpha 是更好的模型。

原文真正提出的,不是「匿名模型猜謎」
Riley 的核心觀察不是「大家快來猜作者」,而是三個本來應該分開的訊號,被社群壓成了一個故事:免費用量被當成品質票選、相似的 API 指紋被當成身分證、單一路由的產品文案被當成完整資料合約。
原文先寫到 10 題 DeepSWE 子集曾讓 Ox Alpha 看起來大幅領先,後續完整測試卻沒有維持那個差距。SiliconANGLE 在 8 月 23 日的報導也明確寫道,當時尚無公開 leaderboard;因此本文只把這段分數當成原文轉述,不把它當成 Ox Alpha 的能力證據。這正是小樣本最常見的陷阱:它可以提出假說,不能替模型加冕。
Matching fingerprints prove shared infrastructure, not identity.
中文:匹配的指紋證明共用基礎設施,不等於證明模型身分。
unclecode,modelprint project docs;SiliconANGLE 原文引述
這句話也是閱讀整起事件最好的界線:我們可以驗證相容性、規格與流量,卻不能從相容性倒推出擁有者。
Ox Alpha 的 37 兆 Token 是真的,但不是你以為的 37 兆
OpenCode 官方資料頁在 2026 年 8 月 25 日 22:04:26 UTC 的快照顯示,Ox Alpha 在觀測窗口內累計約 37.32 兆 tokens、430,943 個「Unique Users」與 11,402,719 個「Completed sessions」,並在 Go+Free 遙測 cohort 的近 7 日 token volume 排名第 1。頁面顯示的 token share 約為 9.2%,input-side cache ratio 則四捨五入為 94%。
這些數字會持續變動,名稱也容易讓人誤解。對照 OpenCode 官方、固定 commit 的 inference query 與 headline reducer,可以得到四個更精確的解讀:
- 約 93% 是 cache-read。37.32 兆中約 34.70 兆是 cached context,未快取 input 約 2.40 兆,output 約 2,199 億,只占總量約 0.59%。這是 OpenCode 記錄到的 route token traffic,卻不是 37 兆個新生成 token。
- 「Unique Users」不是期間去重真人。系統先逐日 approximate-distinct user key,再把每日數字相加;同一人跨日或跨 key 可重複,共用 workspace/API key 也可能代表多人。
- 「Completed sessions」不是 1,140 萬件成功任務。它是逐日計算
generation.completed事件中的 session ID 後再相加,而且查詢沒有要求 outcome 必須成功。 - 榜首只描述這個觀測範圍。資料頁合併 Go 與 Free tier,並把數個 Ox route alias 正規化;它不是全部 OpenCode 使用量,更不是全球 coding model 市占率。

若想看 cache 數字如何在 agent 工作流中膨脹,AlphaLab 的四回合 Prefix Cache Trace會比單看總 token 更接近真實成本;而LLM API Token 與 Cache 拆帳則提醒,不同平台的 usage 欄位不能直接相加。
免費預覽把採用訊號放大,榜單仍有價值
OpenRouter 的 Programming collection保留的 2026 年 8 月 17 日當週資料中,Ox Alpha 以約 7.514 兆 tokens 排名第 2;新一週開始後,頁面名次與 token 數又迅速變動。這仍是強烈的採用訊號,但它衡量的是 OpenRouter 上的 prompt+completion token volume,不是 requests、付費意願、任務成功率或程式能力。
免費、接近 100 萬 token 的宣告 context、被 coding agent 預設曝光,三者會一起提高流量。一個長任務會反覆帶入 repository context、工具輸出與對話狀態;即使大量內容走 cache,統計上的 token volume 仍會快速增長。因此這次爆發最可靠的結論是:低摩擦分發能在幾天內把 coding workload 導向新 endpoint。至於品質,仍應回到固定任務集、pass rate、review defects、延遲與失敗重試率。這也是3,431 tokens/s benchmark 邊界反覆強調的判讀方式。
1.05M context 能驗,作者仍不能
OpenRouter 官方 models API在本文查核時列出 Ox Alpha 的 1,048,576-token context、131,072-token maximum completion、text/image/video input 與 text output,prompt 和 completion 價格都是 0;created timestamp 對應 2026 年 8 月 20 日 20:04:55 UTC。這些是 route 公布的規格與預覽價格,不是獨立 long-context 測試,也不保證免費狀態會延續。
身分方面,modelprint最初以 9 組 infrastructure probes 比對多個候選,Ox Alpha 與 GLM-5.3 命中 6 組,包含 4 組 normalized tokenizer counts。另一份可重現的黑箱比較則讓 Ox Alpha 與 GLM-5.3 的 24 組 baseline-adjusted token deltas 全數吻合。這讓「GLM-5 家族或相容 serving stack」成為目前較強的假說,卻仍無法排除 fine-tune、adapter、distillation、相同 tokenizer、動態路由或刻意相容的服務層。
截至 2026 年 8 月 26 日,OpenRouter 官方頁仍把 Ox Alpha 描述為匿名第三方營運的 stealth model,OpenCode 資料頁的 author/provider 也仍是 Unknown;因此本文不把任何實驗室寫成已確認作者。最精確的表述是「營運方未對使用者公開」,而不是聲稱平台內部也不知道。類似的歸因邊界,在模型+Harness 的長任務案例也同樣重要:你看到的結果往往來自模型、route、cache、工具與 agent harness 的組合。
真正的風險,是同名模型有不同資料邊界
OpenRouter 的 Ox Alpha 頁面明確警告:provider 會保留 prompts 與 completions,OpenRouter 不是開發者、擁有者或 provider。問題在於「是否用於訓練」的公開文件互相衝突:模型頁說不會,provider table卻把 Stealth 標成「Trains: Yes」,而具約束力的 Stealth EULA又允許為 training、evaluation 與 improvement 使用內容。Supplemental terms在查核時沒有列出 Ox Alpha 的特別例外。

因此,OpenRouter route 可以確定的是provider 會保留內容;官方 provider table 標示「Retains prompts」,model page 與 EULA 則沒有列出明確刪除期限。內容實際上是否已被拿去訓練並未公開,但契約權限並不含糊:Stealth EULA 明確授權 training、evaluation 與 improvement,並授予永久的內容授權;與它衝突的是 model-specific 頁面宣稱「not used for training」。若你的決策涉及敏感資料,合理的風險姿態是先按「允許訓練」處理,直到平台提出 Ox Alpha 專屬、優先適用的書面例外。
| Route | 官方保留說法 | 官方訓練說法 | 本文判讀 |
|---|---|---|---|
OpenRouter stealth/ox-alpha | Provider 保留;model page/EULA 未列刪除期限 | 模型頁說不會;EULA 明確授權,provider table 標示 Yes | 實際用途未公開;契約允許 training |
OpenCode Go ox-alpha-free | 0 天 | Not used | route-specific 文件承諾,非獨立稽核 |
OpenCode Zen x-preview-f-free | Zero retention | 不訓練 | route-specific 文件承諾,且仍收 usage metadata |
OpenCode Go 與 Zen 文件分別宣稱 0-day/ZDR 且不訓練,OpenCode privacy policy 也說 prompt content 不由 OpenCode 儲存;但它的一般條款同時保留未付費帳號內容可用於改進服務的較廣文字。這是未付費帳號的一般 TOS,不能直接外推到付費 Go 或每一種 Zen 使用情境;它也不等於 Ox provider 一定拿內容訓練,卻足以說明:不要把簡短 privacy table 當成端到端資料流的全部答案。
AlphaLab 判斷:這是一場分發實驗,不是新王登基
我同意原文最重要的提醒:匿名 provider 接住大量 coding-tool traffic 與 User Content,信任問題比「模型到底像誰」更急迫。但我會把結論再分清楚一點。
- 採用是真的。近 7 日 cohort 第 1 與數十兆 cache-inclusive tokens,顯示大量 observed user keys(可能對應 user、workspace 或 API key)把工作負載導入一個免費、長 context 的新 route,也反映 OpenCode 的分發能力。
- 品質仍未被證明。token volume、daily user-key sum 與 session-ID sum 都不能替代 task-level eval;未公開的完整 benchmark 更不能寫成定論。
- GLM 線索有資訊量,但沒有所有權效力。相同 tokenizer 與 capability surface 能縮小候選範圍,不能告訴你誰負責營運、資料處理與事故回應。
- route 是模型產品的一部分。相同名稱若經不同 gateway、cache 與契約送出,就有不同風險;模型選擇不該只記一個 display name。
所以 Ox Alpha 很適合當成隔離環境中的評測對象,目前卻不適合當成承載機密原始碼、客戶資料或 production credentials 的 trust anchor。這不是因為匿名必然惡意,而是因為你尚未取得能分配責任、驗證承諾與處理事故所需的基本資訊。
現在想試 Ox Alpha,至少留下這四份證據
- 隔離資料:只用公開 repository、synthetic task 或可丟棄分支;移除 secrets、客戶資料與內部文件。
- 固定 route:記錄 gateway、完整 model ID、日期、region、ZDR/retention 設定與當日 terms 截圖,避免日後把不同路由當成同一實驗。
- 固定任務:用同一組 repo、tests、time budget 與 reference model,比較 pass rate、review defects、latency、retry 與人工修正,不拿總 tokens 當答案。可參考MTPLX × OpenCode 長任務 A/B Test的 flight recorder 思路。
- 分開簽核:功能評測過關不等於 privacy/legal 過關;營運方、保留期間與契約優先順序未釐清前,production gate 應維持關閉。
接下來最值得看的,不是 37 兆變成 50 兆,而是三件事:provider 是否正式現身、是否發布 model card 與可重現 eval、以及免費預覽結束後,真實付費與任務成功率能否留住同一批 workload。那時我們才有資格討論 Ox Alpha 是長期產品,還是一場極其成功的匿名分發測試。
接著閱讀
左右滑動查看更多推薦






