跳到主要內容

Qwen3.8-2.4T-A95B 開放權重:5TB Max 級模型代表什麼?(2026)

最後更新: ·
Qwen3.8-2.4T-A95B 開放權重首圖:5TB 權重,誰跑得動?

2026 年 8 月 12 日,Qwen 團隊在 Hugging Face 正式公開 Qwen3.8-2.4T-A95B 的模型卡與權重,並同步登上 ModelScope。這個 MoE 模型約有 2.4 兆總參數、每個 token 啟用 950 億參數,原始 BF16 權重接近 4.9 TB。真正值得注意的,不是「一般人終於能在家跑 Max」,而是 Qwen 第一次讓外界下載、檢查與改造一個自己歸入 Max 級,而且官方稱為商用 Qwen3.8-Max 基礎模型的 checkpoint。

先把原始模型卡放在這裡。點擊下面這張截圖,會在新分頁打開 Qwen3.8-2.4T-A95B 的 Hugging Face 頁面;接下來我會先忠實整理官方到底公開了什麼,再拆解 95B activated、101 萬 token、約 5 TB 權重各自代表什麼,最後檢查授權、部署門檻與「首次 Max 級」這句話的邊界。

Qwen3.8-2.4T-A95B 的 Hugging Face 官方模型卡截圖;點擊圖片前往原始頁面。
Qwen3.8-2.4T-A95B 的 Hugging Face 官方模型卡。截圖顯示 2.4T 參數、BF16、文字生成與自訂授權標示;點圖前往原始頁面。

一、Qwen 說的「首次 Max 級公開」是什麼意思?

模型卡最重要的一句不是 benchmark,而是這段定位:

“For the first time, Qwen3.8 brings a Qwen-Max-class model to open release.”

中文:「Qwen3.8 首次把一個 Qwen-Max 級模型帶到公開釋出。」

— Qwen3.8-2.4T-A95B 官方模型卡

這句話成立,但要把主詞看清楚。「Max 級」是 Qwen 自己的產品分級,不是產業共同認證的客觀標準;「首次」也只是在說 Qwen 自家的歷史。過去超過 1T 參數的 Qwen3-Max 主要透過 API 與 Qwen Chat 提供;此前公開權重的 Qwen3-Coder 是 480B-A35B,Qwen3.5 旗艦則是 397B-A17B。現在把總參數推到 2.4T、啟用參數推到 95B,確實跨過了 Qwen 自己原本把權重關在服務後面的那條線。

但它不是全球第一個多兆參數的開放權重模型,也不是目前最大的紀錄。Moonshot AI 已公開的 Kimi K3 是 2.8T 總參數、104B activated。這次發布的歷史意義應精確寫成:Qwen 首次把自己所稱的 Max 級模型權重交到外界手上,而不是「全球首次」或「史上最大」。


二、2.4T、95B activated 與 101 萬 context,分別在說什麼?

官方模型卡列出的核心規格是:總參數 2.4 兆、啟用參數 950 億;原生 context 為 262,144 token,官方稱可延伸至 1,010,000 token。

Hugging Face API 實際列出的 BF16 參數量是 2,446,182,725,504,所以 2.4T 是合理約數。架構共有 92 層,每層配置 512 個 routed experts;每個 token 會選 10 個 routed experts,再加上一個 shared expert。950 億則是 token 穿過整個網路時,參與這條計算路徑的參數總量約數,約占 2.4T 的 3.9%。

這正是 MoE(Mixture of Experts)的交換條件:它像一座有 2.4 兆本書的圖書館,但每次回答只調出其中一小部分專家。這讓模型容量可以比每個 token 的運算量長得更快;代價是所有權重仍要被儲存並讓推論系統隨時可存取。若追求低延遲與高吞吐,部署 recipe 會把它們切分到叢集的 aggregate accelerator memory,並承擔專家路由與跨卡通訊成本。因此「95B activated」不等於「它就是一個普通 95B dense 模型」,更不代表記憶體只需容納 95B 權重。

context 也有同樣的文字陷阱。隨附的 固定版本 config.json 只把 max_position_embeddings 設為 262,144,沒有附上 1,010,000 的 RoPE scaling 或延伸 recipe。換句話說,262K 是原生設定;約 101 萬是官方宣稱的可延伸上限,不是下載後自動得到的預設值。


三、為什麼約 5 TB 權重不是一般人的「本地模型」?

Hugging Face 固定快照的 safetensors index 記載 tensor payload 為 4,892,365,451,008 bytes,也就是 4.892 TB(約 4.45 TiB);實際下載則分成 213 個 BF16 shard。這只是模型權重;真正服務時還要留下 runtime、通訊 buffer、context state 與併發請求的空間。

SGLang 的部署 cookbook 把現實寫得很直白:BF16 約 4.8 TB、FP8 約 2.4 TB、NVFP4 約 1.2 TB;它提供的 BF16 範例(頁面標為 Not Verified)需要在 8 個 GB300 節點上做 TP32,連 FP8 都塞不進它列出的任何單一 8-GPU 節點。能在單一節點服務,已經是 8 張 B300 或 MI350X/MI355X 等資料中心卡搭配 FP4 checkpoint 的範圍。

現在確實已有 Qwen 官方 FP8RadixArk NVFP4 等低精度版本,所以不能說「只有 5 TB BF16 能下載」。但即使壓到約 1.2~1.5 TB 級,這仍是機房部署,不是一般人用一張消費級 GPU、甚至一台高階桌機就能以實用速度運行的 local LLM。想理解真正可在 24GB GPU 上工作的模型,可以對照 Muse Glimmer 30B 本機 Agent 實測;兩者的硬體語境完全不同。


四、下載到的 checkpoint,不是完整商用 Qwen3.8-Max

這是整篇最容易被標題吃掉的差異。模型卡把 Qwen3.8-Max 定義為以 Qwen3.8-2.4T-A95B 為基礎的官方版本,另外加入視覺輸入、non-thinking 支援、預設 1M context 與官方內建工具等功能。

可下載版本只接受文字輸入,而且每次回覆都必須進入 thinking;推理深度可以在 xhigh、medium、low 之間調整,但不能完全關閉。託管版 Max 才另外提供視覺輸入、預設 1M context、non-thinking 與內建工具。因此最準確的說法是:Qwen 公開了一個 Max 級、作為 Qwen3.8-Max 基礎的語言模型 checkpoint;它不是把商用 Max 的完整產品能力原封不動上傳。

同理,官方模型卡放的成績表欄位名稱是「Qwen3.8-Max」,不是下載 checkpoint 的完整型號。下面這張官方總覽可以幫你理解 Qwen 想把 Max 放在哪個競爭位置,但它是供應商自己整理的測試,不是第三方審計,也不能默認為開放權重版已在相同環境重跑出一模一樣的結果。

Qwen 官方整理的 Qwen3.8-Max benchmark 總覽,涵蓋軟體工程、研究、cowork 與視覺任務。
圖/Qwen 官方的 Qwen3.8-Max benchmark 總覽。這是供應商測試,且欄位指向託管版 Max;不能直接當成開放 checkpoint 的獨立重現成績。點圖前往官方說明。

五、它是「開放權重」,為什麼不宜直接叫開源?

Hugging Face metadata 把授權標成 license: other、名稱是 qwen3.8-max自訂 Qwen3.8-Max license 的確廣泛允許使用、複製、修改、散布、部署、託管、微調與衍生作品,但也附帶幾個實質條件:

  • 軟體與實質部分的副本必須保留授權與著作權聲明。
  • 模型或其衍生作品用於商業產品/服務,若超過 1 億月活躍用戶,或單月營收超過 2,000 萬美元,介面要醒目顯示相應模型名稱。
  • 從事 MaaS,或獨立 coding/office AI assistant 業務,且自己與關係企業在連續 12 個月的總營收超過 5,000 萬美元,就要在商用前另向 Qwen 取得授權;純內部使用的例外,前提是不向第三方提供模型、模型輸出或底層模型能力。

更重要的是,這個 repo 實際公開的是 post-trained 權重與隨附的 config、tokenizer、chat template;現行檔案樹沒有資料處理/篩選與訓練程式、預訓練/後訓練 recipe、訓練參數、optimizer state 或中間 checkpoint,也沒有完整說明訓練資料 provenance、範圍、取得、標註與篩選方式的 data information。若採 OSI《Open Source AI Definition》的標準,開源 AI 還須允許任何人無須另行許可地為任何目的使用、研究、修改與分享,並提供包含資料資訊、完整訓練/執行程式與參數的首選修改形式。Qwen3.8-2.4T-A95B 的自訂授權與釋出內容都未達到這個標準。因此本文使用「開放權重」(open weights):外界拿得到模型參數,但不等於整個訓練系統都開源,也不等於授權毫無用途限制。


六、為什麼研究社群還是很興奮?

截至 2026 年 8 月 13 日 13:30(台北時間),Hugging Face 頁面約有 580 個 likesr/LocalLLaMA 發布串則來到約 1.4K 票、365 則留言。這些數字會持續變動,而且熱度不是品質證明;但至少顯示不少社群成員對可下載 tensors 的期待。

封閉 API 讓你看到輸入與輸出;開放權重則讓有足夠基礎設施的研究團隊做白箱檢查、觀察 logits 與 hidden states、自行測量量化誤差、替自己的 serving stack 寫 kernel,或在自訂授權條件內把它當教師模型探索蒸餾實驗。這些工作不保證一定能保留旗艦能力,也不會憑空消除 2.4T 模型的運算成本,但它們把「只能相信供應商」改成「至少有團隊可以對 checkpoint 的部分主張做獨立測試與改造」。

這就是發布的真正門檻:它沒有把完整商用 Max 公開,也沒有讓這個 Max 級 checkpoint 變成人人可跑,卻把誰能稽核、誰能做系統研究的邊界往外推了一層。對模型透明度而言,這比再多一張 benchmark 表更有價值。


七、AlphaLab 的判讀:這是研究存取的里程碑,不是本地 AI 民主化

判讀一:最稀缺的不是「可下載」,而是可被反駁

權重公開後,外部團隊多了一條檢查這份 checkpoint 的架構、量化行為、原生 262K context、內部 tensors 與執行路徑的路;但約 101 萬 token 的延伸設定,以及託管 Max 的內建工具、視覺與 non-thinking 能力,仍不能只靠這個 checkpoint 單獨重現或推翻。這不是完全透明——訓練資料資訊與 recipe 仍然不在場——但比只能對 API 丟 prompt 前進了一大步。前沿模型的公共價值,不只在「有多少人能按下執行」,也在「有多少人能檢查模型內部 tensors 與執行路徑」。

判讀二:MoE 把運算稀疏化,沒有把基礎設施魔法化

95B activated 很容易被讀成「95B 的成本,得到 2.4T 的能力」。真正情況是:MoE 讓每個 token 不必計算所有專家,卻把權重常駐、專家路由、跨卡通訊與容錯變成新的成本。總參數決定儲存與模型分片的壓力,啟用參數主要影響每 token 計算;兩個數字不能互相取代。這也是為什麼 把大型 MoE 搬上 Apple Silicon 需要專門的 runtime 工程,而不是只改一個下載指令。

判讀三:真正會加速的,是它周圍的生態

絕大多數讀者不會直接部署 2.4T BF16,但開放 checkpoint 會讓量化團隊、推論框架、雲端服務、蒸餾研究與安全稽核有共同標的。FP8 與 NVFP4 版本在發布後迅速公開,就是最早的證據。未來真正傳到一般使用者手上的,可能不是這 5 TB 本體,而是從它衍生出的較小模型、更好的 MoE kernel,以及更可靠的評測方法。

判讀四:不要用開放權重替商用 Max 的全部能力背書

Qwen 把兩者的關係寫成「based on」,並列出託管版另加的視覺、non-thinking、預設 1M 與工具能力。這代表研究者可以檢查一個重要的語言核心,卻不能據此宣稱商用 Max 的每個模組、後處理與實際工作負載都已公開。對 benchmark 也應採同一標準:先問測的是哪個版本、哪套 harness、是否有第三方重跑,再談排名。


八、你接下來該怎麼看這個模型?

  • 一般使用者:別把「open weights」誤讀成「可以在自己的電腦跑」。若只是要用能力,託管 API 或真正能放進現有硬體的 30B~70B 模型更實際。
  • 研究與基礎設施團隊:先從 FP8/FP4 checkpoint、SGLang 官方 cookbook 列出的拓撲與自己的工作負載開始;262K 是原生設定,約 101 萬是官方宣稱、但目前未附 RoPE scaling/延伸 recipe 的延伸上限,兩者都不是免費的吞吐量。
  • 要做蒸餾或微調的團隊:先算教師推論成本與資料治理,再談 student;公開權重不會自動提供高品質蒸餾資料或完整 training recipe。
  • 商業部署者:在上線前把 Qwen3.8-Max 自訂 license 的授權聲明保留義務、介面模型名稱標示門檻,以及特定大型 MaaS/AI Work Assistant 業者的另授權條款納入產品審查,不要只看 Hugging Face 上那個下載按鈕。

一句話收束:Qwen3.8-2.4T-A95B 改變的是「誰能研究前沿語言模型」,不是「誰能輕鬆擁有前沿算力」。它是 Qwen 開放策略的重要跨線,也是資料中心級模型;把這兩件事同時看見,才不會把一次值得肯定的透明度進展,誤包裝成不存在的本地 AI 革命。

接著閱讀

左右滑動查看更多推薦

若你只想判斷這波發布是否和自己有關,先回答一個問題:你要的是「使用託管 Max 的完整能力」,還是「研究公開的 Max 級基礎 checkpoint」?前者先選 API,後者才需要開始規劃叢集、量化與授權。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。