跳到主要內容

Qwen3.8-Flash-Next:6B 活躍,不是 6B 模型(2026)

最後更新: ·
Qwen3.8-Flash-Next 以 6B 活躍參數對比約 180B 儲存權重的 AlphaLab 特色圖

2026 年 8 月 26 日,Qwen Team 在 Qwen 官方網站發布〈Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency〉,把一個實驗性多模態開放權重模型連同技術報告提前交到社群手上。Qwen3.8-Flash-Next 最吸睛的數字是「每個 token 只啟用 6B 參數」;但真正值得追的問題,不是它像不像一個 6B 小模型,而是 Qwen 如何把算力、顯存、主記憶體與長 Context 重新分工。

Qwen3.8-Flash-Next 官方發布文章瀏覽器畫面
Qwen3.8-Flash-Next 官方發布文章;點圖可閱讀原文。圖/Qwen Team

下面先忠實整理原文提出的四個架構改動,再用公開模型檔、技術報告、執行框架與發布後的第三方端點測試逐項查證,最後回答兩件更實際的事:這套設計究竟把成本降到哪裡,以及研究者、部署團隊與一般使用者現在應該怎麼看它。

這不是 Qwen4 發布,而是架構先交卷

Qwen 對這次發布的定位很克制:Qwen3.8-Flash-Next 是「將支撐 Qwen4 的架構」之實驗性預覽,不是完整 Qwen4 家族。公開內容包括 模型權重與設定檔,以及 技術報告;這使外界至少能核對參數形狀、層次安排與 Context 設定,而不只觀看一張發布簡報。

This experimental preview of the architecture that will underpin Qwen4.

中文:這是預計支撐 Qwen4 之架構的實驗性預覽。

Qwen3.8-Flash-Next model card

「開放權重」也比「開源 Qwen4」準確。它採用 Qwen Community License 1.0,不是 Apache-2.0 或 MIT。授權廣泛允許使用、修改與一般商業利用,但若商業產品或服務超過 1 億月活躍使用者,或月營收超過 2,000 萬美元,就有在介面顯著展示模型名稱的條件;符合條文定義的 MaaS 或獨立程式開發/辦公 AI 助手業務,商用前還需另取 Qwen 授權,純內部使用則有條文所列的例外。架構可研究,不代表所有商業用途都沒有邊界。

6B 活躍,為何權重仍接近 360GB?

Qwen3.8-Flash-Next 的 GDN、QSA、Gated Residual 與 n-gram Memory 架構圖
模型把三層 Gated DeltaNet 與一層 Qwen Sparse Attention 交錯排列,並加入四路 Gated Residual 與 n-gram Memory。圖/Qwen Team

公開 model card 把 checkpoint 拆成 125B 主模型、51B n-gram 查找表與獨立的 4B MTP 模組,合計約 180B stored parameters;Hugging Face 上 BF16 檔案約 335.28 GiB,約等於 360GB 十進位容量。所謂 6B,是語言主幹的稀疏 MoE 在生成一個 token 時啟用的參數量,不是模型的總儲存量,更不是一張消費級顯示卡就能完整裝下的承諾。

這個區別揭示 Qwen3.8-Flash-Next 的核心賭注:推論不必每次讀完所有能力,但整套能力仍得放在某個記憶體階層。算術負擔變小,模型容量沒有憑空消失;成本從「每個 token 做多少乘加」轉向「哪些權重留在 GPU、哪些放在 CPU RAM、資料能否及時預取」。

GDN 負責記住,QSA 負責精準找回

GDN efficiently “remembers,” while QSA precisely “retrieves.”

中文:GDN 高效率地「記住」,QSA 則精準地「找回」。

Qwen Team

Gated DeltaNet(GDN)以固定狀態逐步吸收序列資訊,適合處理大量背景;但固定狀態不可能無損保留每一個 token。於是 Qwen 每三層 GDN 插入一層 QSA,讓模型在真的需要逐 token 比對時,回到原始 Context 中選取相關區塊。公開設定檔可核對出 36 層線性注意力與 12 層 QSA,正好是 3:1。

Qwen Sparse Attention 使用 micro-block indexer 選出相關 Context 區塊的流程圖
QSA 先把 Context 壓成 micro-block,由輕量 indexer 選出相關區塊,再對選中的 token 執行稀疏注意力。圖/Qwen Team

具體來說,QSA 先將每四個 token 聚合成 micro-block,再選出最多 512 個 block,也就是 2,048 個 token 的預算,交給核心注意力處理。這大幅縮小昂貴的注意力範圍,卻不等於把所有工作都變成線性:indexer 仍須比較壓縮後的查詢與區塊。比較穩妥的說法是「把精確檢索集中在少量候選」,不是「終結平方複雜度」。

n-gram Memory:用容量換取便宜的常見模式

第二層加入的 n-gram Memory,會把常見 bi-gram/tri-gram 映射到一張 2,000 萬項的查找表。它的優勢是查一次表就能帶入大量靜態局部模式,幾乎不增加每個 token 的神經網路運算;代價則是約 51.2B 參數的龐大儲存。這張表可以放到主記憶體,但 BF16 本身約佔 95.37 GiB,FP8 也約需一半容量,還沒算執行時額外空間。

但 n-gram Memory 不是可編輯的知識庫,也不能取代 RAG。它學到的是固定的局部詞組模式;Qwen 自己的 ablation 甚至顯示,當總參數固定時,把容量分給 n-gram 表並未在所有通用下游任務穩定勝過更大的 MoE。它比較像把高頻模式放進便宜但龐大的「冷層」,而非另建一個可靠的事實資料庫。

Gated Residual 把一條資訊高速公路拓成四線

傳統 Transformer 讓每一層沿同一條 residual stream 讀寫。Qwen 的 Gated Residual 將它擴成四路,透過 gate 決定某層讀取哪些路、再把結果寫回哪裡。這可能讓不同資訊在深層網路中少互相干擾,但同樣不是憑空出現的新概念:它延續多路 residual、Hyper-Connections 與 gated routing 的研究脈絡。Qwen 的價值在於把它與 GDN、QSA、MoE、n-gram Memory 和 MTP 一起整合到同一個可檢查的 checkpoint。

7.6 倍與 4.9 倍,不能直接當成整台服務的加速

Qwen 官方測試中 Qwen3.8-Flash-Next 在高 prefix cache 命中率下的相對 prefill throughput 圖
Qwen 官方在 90% prefix cache 命中率下的相對 prefill throughput 測試;這是第一方結果,且不等同端到端服務速度。圖/Qwen Team

技術報告宣稱,在 1M Context 的注意力模組測試中,QSA 相對 dense attention 的 kernel-level prefill 與 decode 延遲分別改善 7.6 倍、4.9 倍。prefill 測的是最後 16K chunk、batch size 1;decode 則是 batch size 4,並以三個 MTP 預測步驟計算。這些數字描述的是 Qwen 團隊在指定設定下量到的注意力 kernel,不是整個模型或線上 API。

因此能保留的結論只有:Qwen 的第一方測試支持「稀疏 kernel 在特定長序列設定更快」,不能把 7.6 倍或圖中的 8.6 倍直接改寫成整個模型、所有硬體與所有工作負載的吞吐提升。真正的端到端成本還會受到 MoE 權重傳輸、n-gram 預取、KV cache、輸出長度、任務成功率與重試次數影響。

第三方端點測試:解碼快,不代表任務一定省

截至 2026 年 8 月 29 日,Artificial Analysis 在 Intelligence Index v4.1.1 給這個條目 55.8 分,頁面四捨五入為 56;其唯一列出的 Alibaba Cloud API 約為每秒 74 個標準化輸出 tokens。不過 provider 資料實際對應的是生產端點 qwen3.8-flash。Qwen 的 model card 說這個生產版本以 Flash-Next 為基礎、另加入預設 1M Context 與工具能力,因此這是對託管生產端點的第三方測試,不是下載同一份開放權重後對 QSA kernel 的獨立重現。

這組測試更值得注意的是成本結構。Artificial Analysis 顯示每個加權評測任務約花 0.097 美元,但這是套用快取假設後的 API 帳單,不是供應商的硬體服務成本;完整 Intelligence Index 評測產生約 1.98 億個輸出 tokens,相較同類模型中位數約 1.10 億,而且其中約九成是推理 tokens,不等於讀者看到的答案字數。同一個 provider 測試雖有約 74 tokens/s 的生成速度,首個答案 token 仍約等 30 秒。這說明便宜的單位 token 與快速解碼都可能是真的,卻不能單獨證明每個成功任務便宜、回應快,或能外推到所有提示與自架環境。

262K 是原生,1M 是延伸能力

模型設定檔的原生上限是 262,144 tokens。若要拉到約 1M,需要額外啟用 factor 4 的 static YaRN;model card 也提醒,長度延伸可能影響較短 Context 的表現。換句話說,「能配置 1M」「在 1M 找到資訊」與「以合理成本可靠完成 1M 任務」是三個不同命題。

Qwen 的內部 MRCR 測試確實顯示 QSA 在 512K 與 1M 優於其 full-attention 對照,但 1M 的絕對分數仍明顯下降。這反而是很有用的訊號:長 Context 的地址空間正在變大,檢索可靠度與經濟可用性卻仍是工程問題,不應由一個最大 token 數字代替。

發布後的現實:架構也需要軟體生態配合

截至 2026 年 8 月 29 日,Transformers 的 Qwen4-Exp 文件已列出模型程式,但架構能正確載入,不代表自動得到 Qwen 宣稱的最佳 sparse kernel 效能。vLLM 官方 recipe 要求專用的實驗 image,並明確標示一般 PyPI 安裝尚不適用;SGLang recipe 同樣要求 day-zero image 或自行建置尚未進入 tagged release 的支援。llama.cpp 的基礎支援已在 8 月 27 日合併,但合併不等於每種硬體、量化與長 Context 都已完成效能驗證。

這不是枝微末節。Qwen3.8-Flash-Next 的效率來自記憶體階層、稀疏 kernel 與預取協同;如果執行框架尚未把這些路徑打通,漂亮的 active parameter 數字不會自動變成低延遲。因此「模型架構」其實也包含一份隱形的 runtime 合約。

Qwen4 真正釋放的訊號

1. 效率不再等於縮小模型

過去談「小模型」,常把參數量、運算量與記憶體混為一談。Qwen3.8-Flash-Next 選的是另一條路:保留接近 180B stored elements 的容量,只讓約 6B 參數參與單步計算。這種設計可能讓大容量模型的 token 更便宜,卻要求部署者把「運算稀疏」與「儲存龐大」同時納入預算。

2. 長 Context 的瓶頸被搬家,沒有消失

GDN 壓縮背景、QSA 精準找回、n-gram 表保存局部模式,三者共同降低每步運算;相對地,索引品質、狀態容量、主記憶體頻寬與資料搬移變得更重要。這是一次瓶頸重排,而非免費午餐。

3. 創新在整合,不在把每個元件都說成首創

Gated DeltaNet、混合線性與稀疏注意力、n-gram embedding、多路 residual 與 Muon 都有先前研究。Qwen 的成績是把這些路線共同擴展到大型多模態 MoE,並釋出權重讓外界檢視。若 Qwen4 沿用這套設計,競爭焦點將從「誰的 dense 模型更大」轉向「誰能把多層記憶體與 runtime 一起做得更成熟」。

4. 開放權重與開放商業模式是兩件事

提前釋出 checkpoint,確實能促進獨立架構審查、量化與執行框架整合;授權同時保留 MaaS、程式開發與辦公助手等高價值商業場景。這不是否定模型的研究價值,而是提醒採用者:技術可行性與授權可行性必須一起審查。

5. 低 token 單價不等於低任務成本

生產端點約 74 tokens/s 與每個評測任務約 0.097 美元,是有用的市場訊號;接近同類中位數 1.8 倍的評測輸出量,則提醒使用者同時追蹤推理預算。模型若用更多 hidden reasoning 換得成功率,未必是不好的交易,但成本比較必須把輸入、快取、推理 tokens、答案 tokens、首字延遲、成功率與重試一起算,不能只看標價。

現在怎麼評估 Qwen3.8-Flash-Next?

  1. 部署前先算完整記憶體帳。 不只看 6B active;把 checkpoint 精度、GPU/CPU RAM、n-gram table、KV cache 與框架額外空間全部列入。
  2. 先用原生 262K 建 baseline。 真的需要 1M 再開 YaRN,並把短 Context 品質與完整 1M 請求分開測。
  3. 固定 runtime 版本。 記錄專用 image、commit、kernel、量化方式與整合狀態;day-zero 的「支援」不等於穩定版的一鍵相容。
  4. 測每個成功任務的成本。 固定 reasoning effort 與最大輸出,連同首字延遲、推理/答案 tokens、快取、成功率與重試一起比較,而不是只比 tokens/s 或每百萬 token 標價。
  5. 把第一方跑分當假說。 在硬體、dtype、batch、cache 命中率與原始 log 可重現前,7.6 倍仍是值得驗證的方向,不是通用結論。

接著閱讀

左右滑動查看更多推薦

Qwen3.8-Flash-Next 最有價值的地方,不是替 Qwen4 預先贏下一張排行榜,而是公開了一個清楚的方向:前沿模型正在把計算、長期狀態、精確檢索與靜態記憶拆到不同層級。發布後的端點測試又補上另一半:token 可以解碼得快、標價可以很低,輸出與等待時間卻仍會改變任務經濟性。6B 活躍參數是故事的入口;能否把整個記憶體階層、runtime 與推理預算穩定控制住,才是這條 Qwen4 架構路線必須回答的問題。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。已訂閱?管理主題偏好(會寄登入連結到你的信箱)