2026 年 8 月 26 日,Z.ai 在官方研究部落格發布〈GLM-5.3-Flash: Frontier Intelligence, Flash Cost〉,也正式確認匿名模型 Ox Alpha 就是 GLM-5.3-Flash。這不是單純的「模型破案」:它把 320B 總參數、每個 token 啟用 18B、1M-token context、MIT 授權權重與每百萬 input/output token 0.15/0.50 美元的標準牌價(限時促銷為 0.075/0.25 美元),綁成一個對開放模型經濟學很難忽視的案例。

本文先忠實整理 Z.ai 公開了什麼,再用 Hugging Face、OpenRouter、Artificial Analysis 與獨立 coding 評測逐項對帳,最後回答更實際的問題:便宜的 API、可下載的權重與可負擔的自架,究竟是不是同一件事。
Ox Alpha 的真身揭曉了,但「匿名實測」不是科學盲測
Ox Alpha 在 OpenRouter 與 OpenCode 匿名出現時,模型廠牌、訓練背景與正式名稱都沒有公開。Z.ai 這次給出最直接的身分聲明:
Before release, we tested GLM-5.3-Flash anonymously as ox-alpha on OpenCode and OpenRouter to gather user feedback.
中文:正式發布前,我們在 OpenCode 與 OpenRouter 以 ox-alpha 之名匿名測試 GLM-5.3-Flash,以蒐集使用者回饋。
Z.ai,〈GLM-5.3-Flash: Frontier Intelligence, Flash Cost〉
這句話足以確認產品對應關係;OpenRouter 現在也列出正式路由 z-ai/glm-5.3-flash。但它不能證明匿名 API 與 Hugging Face checkpoint 在量化、system prompt、tool parser、安全層與 serving stack 上逐位元相同。免費額度、匿名話題與 1M context 可能影響試用量與樣本組成,因此匿名流量不能直接當作品質偏好的盲測結果。
因此,這篇文章在 Ox Alpha 匿名期間留下的核心疑問,現在只解開了一半:我們知道誰在做模型,卻不能從身分推論匿名期各 route 的資料條款;本文以下聚焦可公開對帳的品質、成本與部署。身分揭曉增加了問責對象,不會自動替匿名期間的每一條 route 補上保存期與訓練用途紀錄。
23.2 兆 token 證明的是分發爆發,不是品質冠軍

OpenRouter 截至 2026 年 8 月 25 日的七日移動視窗(8 月 19–25 日、UTC 完整日桶)顯示,Ox Alpha 以約 23.25 兆個 prompt 加 completion token居首,約為第二名 2.00 倍;其中約 98.4% 是 prompt token,且排行榜排除使用者設為 private 的流量。這說明它拿到驚人的 token 流量與分發,卻不能換算成 23.2 兆次回答、使用者人數、滿意度、付費需求,也不能單憑輸入占比推定平均 context 長度。
社群熱度同樣真實。截至 2026 年 8 月 27 日 06:18(台北時間;發文後約 8 小時 10 分),Hacker News 討論串的官方 API 顯示 783 points、383 則 comments;但熱度裡同時包含好奇、價格、匿名身分與實際體驗。要判讀模型能力,仍應回到固定題組、相同 harness 與失敗紀錄,而不是把排行榜上的「熱門」誤讀成「最好」。這也是閱讀任何 AI 模型排行榜最重要的第一步。
真正公開的硬證據:320B/18B、混合注意力、1M context 與 MIT 權重
官方 model card 與 公開 config讓幾個規格可以交叉核對:模型約 320B 總參數、每個 token 啟用 18B;文字骨幹共有 45 層,其中 34 層 linear attention、11 層 DeepSeek sparse attention。MoE 設定有 288 個 routed experts,每個 token 選 8 個。最大位置長度為 1,048,576,並帶有圖像與影片設定。

Hugging Face 主模型庫目前可直接下載,授權檔是 MIT;截至 2026 年 8 月 27 日,62 個 FP8/混合精度權重 shard 合計約 328 GB(約 306 GiB),另有 120 個 shard、約 643 GB 的獨立 BF16 repo。這使它成為MIT 授權的開放權重模型,允許廣泛使用、修改與再散布。
截至同日,官方 Flash 部落格與 model card 未提供完整 30T-token corpus 清單或可重建 Flash 的完整訓練配方;model card 所引技術報告仍是 2 月發布的 GLM-5 報告。因此,「開放權重」比不加限定的「完整開源 AI」更精確。
也因此,18B active 千萬不能簡寫成「18B 模型」。前者描述每個 token 選到的計算路徑,完整權重仍要能被記憶體或儲存系統有效存取。KTransformers 自架教學以約 306 GiB 的 FP8 權重為例,建議至少 350 GB system RAM;SGLang cookbook列出的 GPU 配置則是 4 至 8 張資料中心 GPU。它確實能自架,但不是把一般 18B dense model 放進單張消費級 GPU 的難度。
價格真的低,但促銷、牌價與自架成本是三本帳
Z.ai 的 官方價格頁列出每百萬 input/cached input/output token 為 0.15/0.03/0.50 美元。2026 年 9 月 9 日 24:00(UTC+8)前限時折半,分別是 0.075/0.015/0.25 美元。相較 GLM-5.2 的 1.40/4.40 美元 input/output 牌價,Flash 約便宜 8.8 至 9.3 倍;「十分之一」是好記的近似值,不是精確比率。

Artificial Analysis 的獨立結果支持「強性價比」:Intelligence Index 四捨五入後為 57,標準牌價口徑每項任務約 0.09 美元。不過圖上 0.045 美元是促銷折扣後的數字。截至 2026 年 8 月 27 日 06:16(台北時間),該站以預設約 10k-input workload、過去 72 小時 P50 計得 output speed 約 48.7 tok/s,低於同類開放權重模型中位數 67;約 1.52 秒 TTFT 指首個 reasoning token,不能直接當成首個答案 token。整套指數測試產生約 1.5 億 output tokens,也高於同類中位數約 1.1 億。換句話說,Flash 單價很低,卻不是每一種工作都會以最少 token 或最快整體時間完成。
權重免費也不代表推論免費。在尚未量測利用率、節點租金或折舊、能耗、維運、並行量與成功率前,不能直接斷言自架較貴;低至中用量通常較難攤平固定成本,高利用率或有資料控制、固定 checkpoint、客製化需求的組織,才值得另做 workload-level TCO。正確比較單位不是每 token 價格,而是同一 workload 的成功率、總 token、端到端時間與每次完成成本。需要拆清 cache 與 provider usage 時,可搭配 LLM API 成本拆帳方法。
「接近 Opus」有根據,但只能限定在上一代與特定評測
Z.ai 的官方表格把 GLM-5.3-Flash 放在 Claude Opus 4.8、GLM-5.2 等模型旁邊,並稱它在雙方都有數據的 coding/agentic 項目全面高於 GLM-5.2。該表混合 Z.ai 自行執行、官方評測服務與 Artificial Analysis 提供的結果;各項 harness、timeout、context 與 judge 也不同,競品分數的完整 provenance 未逐項交代,因此不能視為同一 harness 的重跑。
獨立證據仍相當有力。Artificial Analysis 頁面四捨五入後,GLM-5.3-Flash 與 Claude Opus 4.8 都顯示 57 分;底層值分別約為 57.459 與 57.330,並非完全相同。DeepSWE v1.1在 2026 年 8 月 26 日 07:38 UTC 產生的 mini-swe-agent/max-effort 資料中,attempt-level pass@1 是 Flash 63.4%±4.4 個百分點(113 題)、Opus 4.8 59.0%±1.8 個百分點(111 題)。兩者區間重疊且 scored task 數不同,所以可說「在部分 coding/agent 評測接近上一代 Opus 4.8」,不能說已統計證明超越,更不能省略版本寫成「追平目前 Claude Opus」。同一榜上的 Opus 5為 73.6%±3.9 個百分點(113 題),差距仍明顯。
Artificial Analysis 的 57 分由九項英文、文字為主的測試加權而成,也不能外推成繁體中文寫作、視覺理解、安全、隱私或百萬 context 可靠度都同樣是 57。若想自己對帳,應像 GLM-5.3 在 Claude Code/OpenCode 的實測方法一樣,固定 agent、工具、時間上限、重試規則與版本,再保存完整失敗軌跡。
原文最容易被忽略的兩個缺口:多模態敘事與國產晶片
第一,Z.ai 把 GLM-5.3-Flash 描述為 GLM-5 系列首個原生多模態模型,但官方既有文件早已把 GLM-5V-Turbo 稱為原生支援圖像、影片與文字的多模態 coding foundation model。Flash 的 config 的確包含 vision 模組,卻不足以讓「首個」這個超級詞在目前文件狀態下成立;本文只保留可驗證的「原生多模態」規格,不沿用首創說法。
第二,Z.ai 稱 Ox Alpha 的全部流量由中國國產 AI 晶片承載,生產叢集有數萬個 accelerator。它也稱在 SGLang 上打造專用推論引擎,結合 W8A8、cache quantization 與 EPD disaggregation,並自述在同一硬體上,端到端 serving performance 達初始 baseline 的 3 倍。這是一個重要的推論工程主張,但 Z.ai 此次發布材料未附晶片型號、叢集位置、batch/concurrency、能耗、原始 throughput、可重算的 Nvidia 對照紀錄或第三方 audit;截至 2026 年 8 月 27 日,本文也未找到獨立複現。
因此,它能支持的結論是「Z.ai 自述已用國產晶片大規模承載 Ox 流量」,不是「中國晶片全面追平 Nvidia」。而 3 倍 serving improvement、3.01 倍 attention compute reduction 與 3 倍 Coding Plan quota,是三個完全不同的分母;都不能改寫成模型端到端快 3 倍。
AlphaLab 的判讀:真正被改寫的是價格錨點,不是物理成本
1. 我同意:高能力 API 的價格錨點被往下拉
分數 57、獨立 coding 成績與 0.15/0.50 美元牌價同時出現,已足以逼迫採購者重新問:「這個工作為什麼一定要用更貴的模型?」即使 Flash 不是速度冠軍,也不必在所有能力上追平 frontier,才能壓縮大量 agentic coding、資料處理與長上下文任務的可接受單價。
2. 我同意:開放權重讓議價權不只停在 API
MIT 權重讓企業能固定 checkpoint、測試不同 serving stack、保留自架選項,也讓第三方供應商有機會提供同一模型。這種可攜性會限制單一 API 業者的鎖定能力。開放模型的真正槓桿,不只是「免費下載」,而是可驗證、可替換與可搬遷;這也呼應 開放權重模型如何改變部署選擇的長期趨勢。
3. 我存疑:18B active 很容易製造錯誤的部署直覺
MoE 把每 token 計算量壓低,卻沒有把 320B 權重憑空消失。若只看 active parameters,會低估記憶體容量、頻寬、expert routing、跨卡通訊與長 context KV cache。對多數團隊而言,Z.ai 的 API 價格與它背後的資料中心級 serving 工程才是一個產品;可下載權重則是另一個工程專案。
4. 我存疑:低價能否跨過促銷期與真實 workload
標準牌價本身已很低,不需要用促銷數字加戲。但長期經濟性仍取決於輸出長度、cache hit、失敗重試、route 品質與服務穩定性。匿名期的 23.2 兆 token 是高流量的分發與市場訊號,不是可重現的壓力測試,也不是長期毛利、SLA 或使用者留存的證明。
現在怎麼測:把排行榜問題改成自己的完成成本
- 鎖定版本與 route:記錄模型 ID、provider、日期、context 上限、thinking 設定與價格;不要把匿名 Ox 結果直接當成每個正式 endpoint 的保證。
- 建立固定小型題組:選 20–50 個真實任務,固定 agent、工具、timeout、重試與成功定義,同時保存錯誤軌跡。
- 用標準牌價做預算:促銷價另列情境,不要讓 9 月 9 日後會消失的折扣主導長期 TCO。
- 量 end-to-end:同時看成功率、總輸入/輸出 token、首 token、完成時間與每次成功成本,而非只比較 tok/s 或 benchmark 總分。
- 評估自架的完整資源:以主 repo 約 328 GB 的 FP8/混合精度權重、記憶體頻寬、並行量、長 context 與維運人力估算;若採 BF16,權重約 643 GB。active parameters 只代表部分計算路徑。
GLM-5.3-Flash 最值得關注的地方,不是它讓 320B 模型突然變成桌機上的 18B 模型,而是它把「上一代 frontier 附近的特定能力」與極低 API 牌價放在同一張採購表上。下一個真正能推翻本文判斷的證據,不會是另一張精選 benchmark 圖,而是促銷結束後的穩定價格、可重現的同 harness 評測,以及不同 provider 在真實任務上的成功成本。
接著閱讀
左右滑動查看更多推薦






