2026 年 8 月 26 日,Qwen Team 在 Qwen 官方網站發布〈Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency〉,把一個實驗性多模態開放權重模型連同技術報告提前交到社群手上。Qwen3.8-Flash-Next 最吸睛的數字是「每個 token 只啟用 6B 參數」;但真正值得追的問題,不是它像不像一個 6B 小模型,而是 Qwen 如何把算力、顯存、主記憶體與長 Context 重新分工。

下面先忠實整理原文提出的四個架構改動,再用公開模型檔、技術報告、執行框架與發布後的第三方端點測試逐項查證,最後回答兩件更實際的事:這套設計究竟把成本降到哪裡,以及研究者、部署團隊與一般使用者現在應該怎麼看它。
這不是 Qwen4 發布,而是架構先交卷
Qwen 對這次發布的定位很克制:Qwen3.8-Flash-Next 是「將支撐 Qwen4 的架構」之實驗性預覽,不是完整 Qwen4 家族。公開內容包括 模型權重與設定檔,以及 技術報告;這使外界至少能核對參數形狀、層次安排與 Context 設定,而不只觀看一張發布簡報。
This experimental preview of the architecture that will underpin Qwen4.
中文:這是預計支撐 Qwen4 之架構的實驗性預覽。
Qwen3.8-Flash-Next model card
「開放權重」也比「開源 Qwen4」準確。它採用 Qwen Community License 1.0,不是 Apache-2.0 或 MIT。授權廣泛允許使用、修改與一般商業利用,但若商業產品或服務超過 1 億月活躍使用者,或月營收超過 2,000 萬美元,就有在介面顯著展示模型名稱的條件;符合條文定義的 MaaS 或獨立程式開發/辦公 AI 助手業務,商用前還需另取 Qwen 授權,純內部使用則有條文所列的例外。架構可研究,不代表所有商業用途都沒有邊界。
6B 活躍,為何權重仍接近 360GB?

公開 model card 把 checkpoint 拆成 125B 主模型、51B n-gram 查找表與獨立的 4B MTP 模組,合計約 180B stored parameters;Hugging Face 上 BF16 檔案約 335.28 GiB,約等於 360GB 十進位容量。所謂 6B,是語言主幹的稀疏 MoE 在生成一個 token 時啟用的參數量,不是模型的總儲存量,更不是一張消費級顯示卡就能完整裝下的承諾。
這個區別揭示 Qwen3.8-Flash-Next 的核心賭注:推論不必每次讀完所有能力,但整套能力仍得放在某個記憶體階層。算術負擔變小,模型容量沒有憑空消失;成本從「每個 token 做多少乘加」轉向「哪些權重留在 GPU、哪些放在 CPU RAM、資料能否及時預取」。
GDN 負責記住,QSA 負責精準找回
GDN efficiently “remembers,” while QSA precisely “retrieves.”
中文:GDN 高效率地「記住」,QSA 則精準地「找回」。
Qwen Team
Gated DeltaNet(GDN)以固定狀態逐步吸收序列資訊,適合處理大量背景;但固定狀態不可能無損保留每一個 token。於是 Qwen 每三層 GDN 插入一層 QSA,讓模型在真的需要逐 token 比對時,回到原始 Context 中選取相關區塊。公開設定檔可核對出 36 層線性注意力與 12 層 QSA,正好是 3:1。

具體來說,QSA 先將每四個 token 聚合成 micro-block,再選出最多 512 個 block,也就是 2,048 個 token 的預算,交給核心注意力處理。這大幅縮小昂貴的注意力範圍,卻不等於把所有工作都變成線性:indexer 仍須比較壓縮後的查詢與區塊。比較穩妥的說法是「把精確檢索集中在少量候選」,不是「終結平方複雜度」。
n-gram Memory:用容量換取便宜的常見模式
第二層加入的 n-gram Memory,會把常見 bi-gram/tri-gram 映射到一張 2,000 萬項的查找表。它的優勢是查一次表就能帶入大量靜態局部模式,幾乎不增加每個 token 的神經網路運算;代價則是約 51.2B 參數的龐大儲存。這張表可以放到主記憶體,但 BF16 本身約佔 95.37 GiB,FP8 也約需一半容量,還沒算執行時額外空間。
但 n-gram Memory 不是可編輯的知識庫,也不能取代 RAG。它學到的是固定的局部詞組模式;Qwen 自己的 ablation 甚至顯示,當總參數固定時,把容量分給 n-gram 表並未在所有通用下游任務穩定勝過更大的 MoE。它比較像把高頻模式放進便宜但龐大的「冷層」,而非另建一個可靠的事實資料庫。
Gated Residual 把一條資訊高速公路拓成四線
傳統 Transformer 讓每一層沿同一條 residual stream 讀寫。Qwen 的 Gated Residual 將它擴成四路,透過 gate 決定某層讀取哪些路、再把結果寫回哪裡。這可能讓不同資訊在深層網路中少互相干擾,但同樣不是憑空出現的新概念:它延續多路 residual、Hyper-Connections 與 gated routing 的研究脈絡。Qwen 的價值在於把它與 GDN、QSA、MoE、n-gram Memory 和 MTP 一起整合到同一個可檢查的 checkpoint。
7.6 倍與 4.9 倍,不能直接當成整台服務的加速

技術報告宣稱,在 1M Context 的注意力模組測試中,QSA 相對 dense attention 的 kernel-level prefill 與 decode 延遲分別改善 7.6 倍、4.9 倍。prefill 測的是最後 16K chunk、batch size 1;decode 則是 batch size 4,並以三個 MTP 預測步驟計算。這些數字描述的是 Qwen 團隊在指定設定下量到的注意力 kernel,不是整個模型或線上 API。
因此能保留的結論只有:Qwen 的第一方測試支持「稀疏 kernel 在特定長序列設定更快」,不能把 7.6 倍或圖中的 8.6 倍直接改寫成整個模型、所有硬體與所有工作負載的吞吐提升。真正的端到端成本還會受到 MoE 權重傳輸、n-gram 預取、KV cache、輸出長度、任務成功率與重試次數影響。
第三方端點測試:解碼快,不代表任務一定省
截至 2026 年 8 月 29 日,Artificial Analysis 在 Intelligence Index v4.1.1 給這個條目 55.8 分,頁面四捨五入為 56;其唯一列出的 Alibaba Cloud API 約為每秒 74 個標準化輸出 tokens。不過 provider 資料實際對應的是生產端點 qwen3.8-flash。Qwen 的 model card 說這個生產版本以 Flash-Next 為基礎、另加入預設 1M Context 與工具能力,因此這是對託管生產端點的第三方測試,不是下載同一份開放權重後對 QSA kernel 的獨立重現。
這組測試更值得注意的是成本結構。Artificial Analysis 顯示每個加權評測任務約花 0.097 美元,但這是套用快取假設後的 API 帳單,不是供應商的硬體服務成本;完整 Intelligence Index 評測產生約 1.98 億個輸出 tokens,相較同類模型中位數約 1.10 億,而且其中約九成是推理 tokens,不等於讀者看到的答案字數。同一個 provider 測試雖有約 74 tokens/s 的生成速度,首個答案 token 仍約等 30 秒。這說明便宜的單位 token 與快速解碼都可能是真的,卻不能單獨證明每個成功任務便宜、回應快,或能外推到所有提示與自架環境。
262K 是原生,1M 是延伸能力
模型設定檔的原生上限是 262,144 tokens。若要拉到約 1M,需要額外啟用 factor 4 的 static YaRN;model card 也提醒,長度延伸可能影響較短 Context 的表現。換句話說,「能配置 1M」「在 1M 找到資訊」與「以合理成本可靠完成 1M 任務」是三個不同命題。
Qwen 的內部 MRCR 測試確實顯示 QSA 在 512K 與 1M 優於其 full-attention 對照,但 1M 的絕對分數仍明顯下降。這反而是很有用的訊號:長 Context 的地址空間正在變大,檢索可靠度與經濟可用性卻仍是工程問題,不應由一個最大 token 數字代替。
發布後的現實:架構也需要軟體生態配合
截至 2026 年 8 月 29 日,Transformers 的 Qwen4-Exp 文件已列出模型程式,但架構能正確載入,不代表自動得到 Qwen 宣稱的最佳 sparse kernel 效能。vLLM 官方 recipe 要求專用的實驗 image,並明確標示一般 PyPI 安裝尚不適用;SGLang recipe 同樣要求 day-zero image 或自行建置尚未進入 tagged release 的支援。llama.cpp 的基礎支援已在 8 月 27 日合併,但合併不等於每種硬體、量化與長 Context 都已完成效能驗證。
這不是枝微末節。Qwen3.8-Flash-Next 的效率來自記憶體階層、稀疏 kernel 與預取協同;如果執行框架尚未把這些路徑打通,漂亮的 active parameter 數字不會自動變成低延遲。因此「模型架構」其實也包含一份隱形的 runtime 合約。
Qwen4 真正釋放的訊號
1. 效率不再等於縮小模型
過去談「小模型」,常把參數量、運算量與記憶體混為一談。Qwen3.8-Flash-Next 選的是另一條路:保留接近 180B stored elements 的容量,只讓約 6B 參數參與單步計算。這種設計可能讓大容量模型的 token 更便宜,卻要求部署者把「運算稀疏」與「儲存龐大」同時納入預算。
2. 長 Context 的瓶頸被搬家,沒有消失
GDN 壓縮背景、QSA 精準找回、n-gram 表保存局部模式,三者共同降低每步運算;相對地,索引品質、狀態容量、主記憶體頻寬與資料搬移變得更重要。這是一次瓶頸重排,而非免費午餐。
3. 創新在整合,不在把每個元件都說成首創
Gated DeltaNet、混合線性與稀疏注意力、n-gram embedding、多路 residual 與 Muon 都有先前研究。Qwen 的成績是把這些路線共同擴展到大型多模態 MoE,並釋出權重讓外界檢視。若 Qwen4 沿用這套設計,競爭焦點將從「誰的 dense 模型更大」轉向「誰能把多層記憶體與 runtime 一起做得更成熟」。
4. 開放權重與開放商業模式是兩件事
提前釋出 checkpoint,確實能促進獨立架構審查、量化與執行框架整合;授權同時保留 MaaS、程式開發與辦公助手等高價值商業場景。這不是否定模型的研究價值,而是提醒採用者:技術可行性與授權可行性必須一起審查。
5. 低 token 單價不等於低任務成本
生產端點約 74 tokens/s 與每個評測任務約 0.097 美元,是有用的市場訊號;接近同類中位數 1.8 倍的評測輸出量,則提醒使用者同時追蹤推理預算。模型若用更多 hidden reasoning 換得成功率,未必是不好的交易,但成本比較必須把輸入、快取、推理 tokens、答案 tokens、首字延遲、成功率與重試一起算,不能只看標價。
現在怎麼評估 Qwen3.8-Flash-Next?
- 部署前先算完整記憶體帳。 不只看 6B active;把 checkpoint 精度、GPU/CPU RAM、n-gram table、KV cache 與框架額外空間全部列入。
- 先用原生 262K 建 baseline。 真的需要 1M 再開 YaRN,並把短 Context 品質與完整 1M 請求分開測。
- 固定 runtime 版本。 記錄專用 image、commit、kernel、量化方式與整合狀態;day-zero 的「支援」不等於穩定版的一鍵相容。
- 測每個成功任務的成本。 固定 reasoning effort 與最大輸出,連同首字延遲、推理/答案 tokens、快取、成功率與重試一起比較,而不是只比 tokens/s 或每百萬 token 標價。
- 把第一方跑分當假說。 在硬體、dtype、batch、cache 命中率與原始 log 可重現前,7.6 倍仍是值得驗證的方向,不是通用結論。
接著閱讀
左右滑動查看更多推薦
Qwen3.8-Flash-Next 最有價值的地方,不是替 Qwen4 預先贏下一張排行榜,而是公開了一個清楚的方向:前沿模型正在把計算、長期狀態、精確檢索與靜態記憶拆到不同層級。發布後的端點測試又補上另一半:token 可以解碼得快、標價可以很低,輸出與等待時間卻仍會改變任務經濟性。6B 活躍參數是故事的入口;能否把整個記憶體階層、runtime 與推理預算穩定控制住,才是這條 Qwen4 架構路線必須回答的問題。






