2026 年 8 月 25 日,ModelScope 在 X 公開 Qwen 的新模型預告;截至翌日 8 月 26 日 06:30(UTC+8),Qwen 在 Hugging Face 的 Qwen3.8-Flash-Next 頁面〈A Preview of the Qwen4 Architecture〉也已上線。這不是一場已經交出權重與跑分的發布會,而是一張把 Qwen4 路線先翻開一角的倒數卡:官方把它描述為多模態 MoE;截至同一查核時間,兩個官方預告頁尚未提供可公開讀取的權重、benchmark、license、config 或完整 model card,架構細節、授權、效能與本機執行條件仍待正式檔案驗證。

預發布就引發熱度,真正有意思的不是「下一個模型會不會更強」這句空話,而是 Qwen 為何選擇在完整 Qwen4 家族之前,先讓一個 Qwen3.8-Flash-Next 模型承擔架構預覽。以下先分開官方事實、社群期待與待驗證項目,再談這種「架構先行」對本機模型生態真正代表什麼。
Qwen3.8-Flash-Next 不是 Qwen4 正式發布,而是一份架構預告
A Preview of the Qwen4 Architecture
中文:Qwen4 架構的預覽。
Qwen/Hugging Face 預告頁
這句短標題把邊界畫得很清楚:主角仍叫 Qwen3.8-Flash-Next,官方說它採用下一代 Qwen4 架構;完整 Qwen4 模型家族則仍在後面。換句話說,現在可以確認的是產品定位與路線承諾,不是「Qwen4 已經推出」,更不能把未具名的 Arena 猜測、社群試算或舊 Qwen3.8 跑分搬來當成這個模型的成績。
ModelScope 的官方預告把它描述為「基于下一代 Qwen4 架构所构建的多模态 MoE 模型」,並說提前公開改進,是為了讓社群替完整 Qwen4 家族做準備。翻成更精確的繁體中文,就是:它是一個以 Qwen4 下一代架構為基礎的多模態混合專家模型,這次先行釋出是生態系準備期。
| 截至 8 月 26 日 06:30(UTC+8)已能確認 | 仍要等正式檔案回答 |
|---|---|
| 名稱是 Qwen3.8-Flash-Next,定位是 Qwen4 架構預覽 | 完整 Qwen4 家族是否採用完全相同的拓撲 |
| Qwen 將它描述為多模態 MoE | 參數規模、專家配置、視覺元件與 Context 長度 |
| ModelScope 列出標準版與 FP8 版為預定產物 | 兩種權重的實際大小、硬體需求與量化相容性 |
| ModelScope 預告資料排定 8 月 26 日 15:00 UTC(UTC+8 為 23:00) | 最終 model card、config、模型程式碼、授權與 benchmark 方法 |
在上述查核時間,ModelScope 的狀態欄仍是未發布預告,Hugging Face 也顯示「Upcoming release」;這是有時間邊界的頁面狀態,不是對未來可用性的斷言。若你在 23:00 之後閱讀,最有價值的動作不是背這張表,而是直接檢查頁面是否已出現可下載檔案、授權與 config。

為什麼一張倒數頁,會先讓本機模型社群動起來?
答案不是大家已經看過能力,而是整合成本會在權重之前到來。8 月 26 日清晨保存的點時快照顯示:06:25(UTC+8)的 Hugging Face 頁面有 1,149 人等待通知,06:26 的 Hacker News 為 304 points、132 則留言;同一時段的 Reddit LocalLLaMA 貼文約為 601 分、158 則留言。這些數字都會變動,而且 Reddit 會模糊化票數;它們只支持一件事:預發布關注度很高,完全不能替模型品質投票。
真正讓開發者緊張的是「新架構」三個字。模型檔案能下載,不等於每個 runtime 都能正確執行;文字生成能跑,也不等於 FP8、GGUF、Apple Silicon、多模態、工具呼叫與長 Context 都已經對齊。對 想在本機部署 Qwen 的讀者而言,release day 其實會同時啟動好幾個時鐘。
| 「支援」的層級 | 它真正代表的事 |
|---|---|
| 供應商 fork 能載入 | 團隊手上的特定分支已有最初實作 |
| 公開 PR | 程式碼可審查,但仍可能改動或未合併 |
| 合併 main branch | 主線取得支援,還不等於穩定套件已發布 |
| 正式版本可安裝 | 一般使用者能透過標準套件取得 |
| 正確且最佳化 | 輸出對齊參考實作,核心算子也有實際效能 |
| 功能完整 | 量化、多模態、工具呼叫與長 Context 都通過驗證 |
Qwen3.8-Flash-Next 的「Unsloth day-zero 支援」目前仍是目標
LocalLLaMA 的熱門標題把事情寫成「day 0 support from Unsloth」,但原始留言更保守。Reddit 帳號 u/yoracale 表示團隊希望做到 day-zero support,同時明確加上兩個限制詞:
this is ‘hopefully’ having day zero support … not guaranteed
中文:這只是「希望」能做到 day-zero 支援,並不保證。
u/yoracale/Reddit
這不是咬文嚼字,而是新架構整合的正常風險。以完整模型名檢索 Unsloth 的公開 GitHub issue/PR 與 release,在上述查核時間未找到名為 Qwen3.8-Flash-Next 的已合併支援;這只描述公開索引,不能排除私有分支或未命名工作。最準確的說法是:該帳號表示團隊正爭取 day-zero 支援,但明說不保證完成。
Qwen3-Next 的整合歷史:正確、合併、最佳化是三個日期
2025 年 9 月 11 日發布的 Qwen3-Next 採用 Gated DeltaNet 與 Gated Attention 的混合架構。Transformers 的初始支援 #40771 於 9 月 9 日合併,接下來三天又處理 config 讀取與實作對齊;vLLM #24526 於 9 月 11 日 07:32 UTC 合併,MLX-LM #441 於 9 月 13 日 00:29 UTC 合併。llama.cpp #16095 則在 9 月 18 日開出、11 月 28 日合併,PR 明說先追求 correctness,效能最佳化留待後續。
這段歷史不代表 Qwen3.8-Flash-Next 一定會慢,也不能拿來預測某個 runtime 的落地日;它證明的是「day zero」若沒有說清楚支援物件,就容易變成行銷縮寫。這次官方刻意把 Qwen4 architecture 放在標題上;在 config 與 reference code 公開前,工程師沒有足夠資料確認既有 loader 能否沿用。
先別把社群流傳規格當成 Qwen4 定案
HN 標題與一張據稱擷取自早期 ModelScope 頁面的社群截圖,流傳了總參數、啟用參數、n-gram 記憶、Qwen Sparse Attention 與訓練成本等說法;但截至查核時間,現行 ModelScope 與 Hugging Face 官方預告頁都未列出這些規格,也未提供可公開讀取的 config、完整 model card 或技術報告。AlphaLab 因此不把這批數字寫成 Qwen3.8-Flash-Next 的既定規格,更不拿它們推算本機 RAM、速度或能力。
其中最容易誤讀的是「啟用參數少,所以模型一定很省記憶體」。MoE 的 activated parameters 主要描述每個 token 走過多少運算路徑;權重常駐、量化格式、視覺元件、KV 或 recurrent state,以及 runtime overhead 是另一組問題。即使正式規格後來證實某個低啟用值,也不能只看那個數字回答你的電腦放不放得下。需要估算時,可先用 本機 LLM 記憶體指南建立權重、快取與 Context 分開計算的習慣。
同樣地,「Flash」目前是名稱,不是經過驗證的 TTFT、prefill、decode 或每瓦吞吐結論;「Qwen4 架構預覽」也不保證完整 Qwen4 家族會原封不動採用每一個元件。把品牌名稱翻成效能結論,正是預發布階段最該避免的捷徑。
AlphaLab 判讀:這是一份提早送達的「整合契約」
我認為 Qwen 這次真正發布的,是一份給生態系的整合契約:模型家族還沒全部登場,runtime、量化與本機工具團隊已先知道 Qwen4 路線即將出現新的相容性工作。對開放權重社群而言,這比一張沒有方法的 benchmark 圖更有現實意義,因為模型能否被普通開發者使用,取決於權重之外的一整條軟體供應鏈。
但這份契約現在只有封面。官方已給出多模態 MoE 與 Qwen4 預覽的方向,還沒有足夠公開材料讓外部重建架構或測量能力。因此,我不會把預發布熱度解讀成性能信任票;也不會因為頁面資料暫時不完整,就反向斷言模型做不到什麼。最合理的姿勢是對方向保持興趣,對結論保持延遲。
對 Qwen 本身,這也是一個可觀察的策略:先讓 Flash-Next 承受 loader、kernel、量化與多模態相容性的第一波摩擦,再把完整 Qwen4 家族推向更成熟的工具鏈。這是我的推論,不是官方承諾;它是否成立,要看接下來的檔案是否足以讓不同 runtime 快速、正確而且可重現地接上。
權重上線後,先看這五件事再決定要不要下載
- 身分與授權:確認 model card、license、checksum 與官方 repository 一致,再決定是否能放進商用或內部流程。
- 真實架構:讀 config 與 model code,核對參數、專家路由、attention、n-gram 元件、視覺模組與 Context,而不是抄預發布截圖。
- runtime 的支援層級:分別確認 Transformers、vLLM、SGLang、llama.cpp、MLX-LM 與 Unsloth 是 fork、PR、main branch 還是 stable release,並看支援的是文字還是完整多模態。
- 可重現的系統數字:至少同時記錄權重常駐、峰值記憶體、TTFT、prefill、decode、batch 與長 Context;不要用單一 tokens/s 取代完整體驗。
- 可歸因的獨立評測:等確切模型身分、版本、量化、硬體、prompt 與評測 harness 都公開,再與 模型排行榜或既有 Qwen 模型比較。
如果你的目標是本機 Agent,還要多加一欄:工具呼叫與長回合穩定度。舊的 Qwen3.8-27B 本機 Agent 測試可以提供測試框架,但結果不能外推到 Flash-Next;應在相同任務、相同工具與相同成功條件下重新跑。
接著閱讀
左右滑動查看更多推薦
Qwen3.8-Flash-Next 值得追,但不是因為倒數頁已經證明它快,而是它讓我們提早看見 Qwen4 與開放權重工具鏈即將碰撞的地方。等檔案上線後,先依序核對身分、授權、架構、runtime 與可重現評測;做到這五步,期待才會從社群情緒變成可以執行的技術判斷。






