GLM-5.3 開放權重不是一場新的模型發表會,而是 Z.ai 在 2026 年 8 月 28 日把 8 月 14 日已上線的模型,真正交付成可下載、可檢查、可修改的 checkpoint。這個差別很重要:API 讓你「使用」模型,權重則讓有能力的團隊「持有」模型;但 753B 參數、約 756GB 的檔案、客製授權與資安能力,也讓「開放」二字遠比按下 Download 複雜。
這篇會做三件事:先還原這次究竟發布了什麼,再把 Z.ai 的 coding/cyber 數字放回 benchmark 版本與執行框架,最後回答一個實際問題——誰真的能從這份權重獲益?
GLM-5.3 開放權重:8 月 28 日交付的是什麼?
Z.ai 在官方公告中把訊息壓成一句話:
“Our most capable model for agentic coding and cyber defense is now available to download, run, and customize.”
中文:我們在代理式程式開發與資安防禦方面能力最強的模型,現在可以下載、執行與客製。
Z.ai,2026 年 8 月 28 日
「現在可以」是這則消息的核心。Z.ai 在8 月 14 日的模型文章已公布 GLM-5.3 與 API,並預告會先做安全評估與強化、兩週後再釋出權重。Z.ai 於 8 月 28 日正式宣布 Hugging Face repository 可供下載,才完成這個承諾。換句話說,這是「權重可取得」的里程碑,不是另一個全新 base model。

753B 參數不等於 753GB:自架先過儲存與記憶體這一關
Hugging Face 模型資料列出 753,329,940,480 個參數;官方權重索引則記錄 141 個 safetensors 分片與 755,617,140,416 bytes,約 755.6GB(703.7GiB)。這個預設推論 repo 以 FP8 為主,仍有約 2.10B 參數採 BF16。兩個「753」看起來很接近,卻是不同單位:前者是參數數量,後者是權重檔案占用的儲存空間。另有一份 BF16 repo,索引總量約 1.507TB。
GLM-5.3 是 Mixture-of-Experts 架構;設定檔顯示共有 256 個 routed experts,每個 token 啟用 8 個。這能降低每次推論動用的計算量,卻不會讓其餘權重從磁碟與記憶體消失。服務上線還要再留 KV cache、runtime workspace、通訊緩衝與並行請求的空間。
因此,「repository 可下載」與「任何電腦都能順跑」是兩件事。vLLM recipe的標準 FP8 範例使用 8×H200/H20,完整 100 萬 token context 使用 8×B200;SGLang recipe另列出 4×GB300 與多種 8-GPU 配置。這些不是「最低硬體保證」,卻足以說明原生 checkpoint 的主要場景是資料中心級服務。低位元量化可以壓低容量,但在同協議測試出現前,不能直接把原生/API benchmark 分數搬到量化版本身上。
能力提升來自 post-training,而不是更大的 base model
Z.ai 對這次能力來源的描述很明確:
“Every gain comes from post-training.”
中文:每一項提升都來自後訓練。
Z.ai,GLM-5.3 model card
GLM-5.3 沿用 GLM-5.2 的 base model;Z.ai 把重點放在複雜 coding、長任務與資安環境的後訓練。這使它成為一個很好的 Post-training Scaling Law案例:模型規模沒有再加大,行為分布卻能因資料、回饋與 agent 環境而明顯改變。也因為改變發生在 post-training,benchmark 更應被理解為「模型+harness+預算」的整體結果,而不是一顆裸模型的固定智商。
原文把機制寫得更具體:Z.ai 增加長任務環境、任務多樣性與後訓練算力,並用 solver/verifier 管線產生可執行、可驗證的訓練環境;它也承認環境生成與驗證仍需要相當程度的人工作業。因此「每一項提升都來自後訓練」描述的是整套資料、環境、reward 與人工檢查系統,不是單一技巧。

Terminal-Bench 3.0:28.3 是發布數字,不是永遠不變的排名
Z.ai 的 model card 報告 GLM-5.3 在 Terminal-Bench 3.0 得到 28.3:使用 Claude Code 2.1.207、max reasoning、400K context、每題三次 rollout 取平均,每次最多 600 turns、10 小時,最後交給官方 verifier 評分。光是這串設定就說明,28.3 衡量的不是模型單獨答題,而是一整套 agent system。
更關鍵的是 benchmark 會版本化與重評。Terminal-Bench 3.0 的歷史 leaderboard在 2026 年 8 月 30 日顯示:GLM-5.3+Claude Code 的 point estimate 已是 32.4%,Fable 5+Claude Code 為 34.0%,GPT-5.6 Sol+Codex 為 34.6%。三者的 95% confidence intervals 重疊,harness 也不全相同;合理結論是 GLM-5.3 位於前段,但這張表不能證明某個裸模型穩定勝過另一個。
同一天,Terminal-Bench 網站預設已切到 4.0。於是 Z.ai 發布圖的 28.3、3.0 歷史頁的 32.4,以及當前 4.0 都可能同時「是真的」,卻回答不同日期、版本與配置的問題。讀 benchmark 最安全的方式不是背一個分數,而是一起保存版本、agent、context、timeout 與 rollout 次數。該列 metadata 的 model_org 是 Z.AI、agent_org 是 Anthropic;它能證明這個 model-agent run 被 leaderboard 收錄,卻不足以證明由哪一方執行或提交,也不是 AlphaLab 重跑了下載後的權重。
CyberGym 84.5:強的是已知漏洞重現,不是「自動找到 84.5% 零日漏洞」
CyberGym Reproduction收錄 188 個開源專案的 1,507 個歷史漏洞。agent 會拿到漏洞描述與未修補程式碼,任務是產生 PoC,且 PoC 必須能在修補前版本觸發、在修補後版本失敗。它是很具體、也很有價值的能力測量,但「重現已知漏洞」與「在未知系統發現零日漏洞」不是同一件事。
Z.ai 的 84.5 是單次 Pass@1,跑完 1,507 題;配置為 Claude Code 2.1.207、max reasoning、不提供一般 web tools(只保留必要套件網域 allowlist)、128K 最大輸出,而且每題沒有固定 timeout 上限。這是 GLM-5.3+該 harness 在受控漏洞重現任務上表現突出的第一方證據,卻不能外推成任意 codebase 的漏洞發現率,也不能回答誤報、修補品質或負責任揭露。

截至 2026 年 8 月 30 日,在 CyberGym 預設的「Model-focused+1 trial」檢視中,Zhipu AI 來源的 GLM-5.3+Claude Code 為 84.5%,排在 GPT-5.5-Cyber 的 85.6% 之後;切到 Agent-focused 會是不同比較集合。CyberGym 自己也提醒:結果由各團隊提交、測試具有隨機性,小幅差距未必代表真實能力差。Z.ai 自己的圖同時顯示 GLM-5.3 在更深的 ExploitBench/ExploitGym 落後 Fable 5 與 GPT-5.6 Sol;最公平的讀法不是「它是最強駭客」,而是「它在已知漏洞 PoC 重現上特別突出,但能力並未均勻覆蓋整條 exploit chain」。
原文還把 benchmark 延伸到真實程式庫:Z.ai 聲稱,與中國多個資安團隊合作,經專家審查、篩選與去重後,模型在 269 個專案中找出 2,436 個漏洞,並建立 Security Disclosure Ledger 追蹤揭露進度。截至 2026 年 8 月 30 日,該站已公告不再展示具體漏洞細節,後續改由 CNVD、CNNVD 與 NVDB 公示。這仍是供應商自己的流程與統計;目前公開入口無法讓讀者逐案對完 2,436 筆,因此不能把總數當成第三方複現,也不能假設每一筆都有 CVE。
開放權重不等於 MIT:GLM-5.3 的客製授權有一道門
GLM-5.3 license廣泛允許使用、複製、修改、散布與銷售模型及衍生品,但它不是 MIT 或 Apache 授權。條文另規定:若 licensee 或關係企業經營 Model-as-a-Service,且任一連續 12 個月合計營收超過 100 億美元,在任何商業使用前必須通過 Z.ai 的安全審查。
對多數研究者與中小團隊,這條門檻可能不會觸發;對大型雲端模型服務商,它卻是實質條件。這也是為什麼最準確的稱呼是「open weights under a custom license」。OSI 的 Open Source AI Definition要求使用者能在不另行取得許可下,為任何目的使用、研究、修改與分享系統,並取得足以修改系統的資料資訊、程式碼與參數。GLM-5.3 的權重確實開放,但不該把這件事直接等同於 OSI 定義下的完整開源 AI。
真正的分水嶺:持有權、能力證據與可營運性是三件事
GLM-5.3 開放權重的價值是真的。它讓有基礎設施的團隊可以在自有環境保存模型、檢查參數、做客製化與離線部署;當模型涉及程式碼與資安工作,資料不離開內網本身就可能是重要理由。這也把模型從供應商隨時可改版、限流或停用的服務,轉成組織能固定版本管理的軟體資產。
但另外兩件事不能被「可下載」代替。第一,benchmark 仍是特定 model-agent 配置下的證據,且這次最受關注的結果主要來自 Z.ai 公布的 model+harness 評測;公開 leaderboard metadata 也不能當成下載權重已被第三方完整複現。第二,756GB 只是權重起點,不是可用服務的總成本。於是這次發布最直接改變的,不是一般使用者今天能否在筆電離線跑 frontier model,而是具備資料中心資源、敏感資料需求或模型研究能力的組織,終於可以把 GLM-5.3 從 API 選項變成自己能保管的 artifact。
資安面則更微妙:Z.ai 公布的 model+harness 評測顯示,GLM-5.3 能重現真實漏洞;這類能力對防守方可用來驗證、修補與訓練,也可能降低攻擊者取得工具的門檻。權重一旦在自有環境執行,供應商 API 的監控、撤銷與即時規則就不再是可靠控制點。這是部署機制帶來的雙重用途,不是已發生濫用的證據;真正值得追問的,是 Z.ai 所稱兩週安全強化究竟用了什麼威脅模型、測試與發布門檻,以及能否把這些內容整理成可稽核、可持續更新的安全報告。
如果你要採用 GLM-5.3,先做這四個檢查
- 固定 artifact:記錄 Hugging Face commit、權重 hash、config 與當時 license,不要只記模型名稱。
- 先算整體容量:把權重、KV cache、runtime、context、並行量與備援一起估,不要用 756GB 直接當成可服務所需記憶體。
- 把 benchmark 寫完整:至少保存版本、harness、reasoning effort、timeout、rollout 與置信區間;量化版要重新測,不沿用原生分數。
- 隔離資安工作負載:只在你有明確授權的程式與環境測試;PoC 與易受攻擊程式應放在受控 container/network 中,限制對外連線與憑證權限,避免把測試環境暴露到公網。
若你只是要把 GLM-5.3 接進 Claude Code 或 OpenCode,先走既有 hosted-first 設定流程,通常比直接搬運 756GB checkpoint 更能回答「它是否適合我的工作」。如果你需要的是版本主權、內網資料邊界或模型研究,這次權重發布才是故事真正開始的地方。
接著閱讀
左右滑動查看更多推薦
下一步不要先問「它是不是榜首」,而是拿一組自己的 coding/security 任務,在相同 harness 與預算下比較 hosted、原生與量化版本;能被你重現的結果,才是採用決策真正需要的 benchmark。






