Qwen-Image-2.1 在 2026 年 9 月 20 日發布後,最吸睛的不是又一張排行榜,而是它把 RGBA 透明度直接放進生成與編輯管線:圖像可以原生帶 alpha channel,不必先生成白底再做去背。不過,Qwen 官方發布文口中的「open-source」,和實際授權條款之間有一道不能略過的界線——權重可公開下載,但研究授權只允許研究與評估用途,商用必須另取授權。

這篇不把發布稿改寫成規格表。我們要回答三個更實際的問題:原生透明度究竟改變了什麼工作流程?「7B」是否真的代表一般顯卡能輕鬆跑?以及,下載得到權重,為什麼仍不能直接拿去做商業產品?
Qwen-Image-2.1 到底發布了什麼?
先校正最容易被標題帶偏的數字。官方說的 7B,是視覺生成元件,也就是 32 層 Single-Stream DiT,不是完整管線只有 70 億參數。官方架構說明另外列出 Qwen3-VL 8B 文字編碼器與 64-channel RGBA VAE;Hugging Face 上七個 safetensors 檔案合計約 33.13 GB。所以「核心縮到 7B」成立,「整套模型很輕」則不成立。
| 元件 | 官方描述 | 讀者該怎麼理解 |
|---|---|---|
| 生成核心 | 約 7B DiT、32 層 | 7B 只描述主要生成器 |
| 文字/影像編碼器 | Qwen3-VL 8B | 完整推理還要載入另一個大型元件 |
| VAE | 64-channel RGBA、16× 壓縮 | alpha 是模型資料流的一部分,不是外掛去背器 |
| 權重檔 | 約 33.13 GB | 下載體積與執行記憶體不能只看「7B」 |
Qwen-Image-2.1 真正重要的新東西:alpha 不再只是後製
“Native transparency is a major addition in this release.”
中文:原生透明度是本次更新的重要新增能力。
Qwen 團隊
一般的「透明圖生成」常是兩段式:模型先畫完整背景,再由分割或去背模型猜出主體邊界。髮絲、玻璃、煙霧、半透明陰影因此很容易出現白邊或硬切。Qwen-Image-2.1 的做法不同:官方文件把 RGB 與 RGBA 都列為原生輸出,提示詞可要求 transparent background;SGLang 的整合文件也把 alpha 描述為連續值,而不是最後套一個二元遮罩。

這個差異很實用。電商商品圖、貼圖、簡報元件、遊戲 sprite、UI 裝飾與合成素材,都可以直接把「透明邊界」納入生成目標。真正值得觀察的不是它能否做出一張看起來透明的示範,而是批次生成時,半透明邊緣能否穩定、主體內部會不會被誤挖空,以及輸出放到深色與淺色背景上是否同樣乾淨。
十張參考圖與局部編輯:模型上限不等於每個後端都做到
Qwen 說「Qwen-Image-2.1 supports up to 10 reference images」,並展示以圈選、塗抹註記或獨立遮罩指定局部修改。這讓它不只是文字生圖器,也更像一個能讀取素材、保留未修改區域、再重組結果的統一編輯模型。

這裡要把「基礎模型規格」和「執行後端限制」分開。Diffusers 的管線可接收影像列表,但vLLM 官方預覽 recipe當時把參考圖上限設為四張,第五張會回傳錯誤。獨立遮罩也應理解為官方展示的一種條件輸入,而不是所有介面都已提供傳統 inpainting 的 mask_image API。若你的流程真的仰賴十張素材或精準遮罩,必須按實際後端逐項驗收。
Qwen-Image-2.1 的 Day-0 支援:可以裝,不等於穩定版已到
官方列出的五個 Day-0 整合並非同一成熟度。截至 2026 年 9 月 21 日,Diffusers、ComfyUI、SGLang 與 LightX2V 的支援已進各自原始碼主線,但發布標籤或打包版可能尚未包含;vLLM-Omni 則仍是未合併的預覽 PR。把它們統稱為「五個框架正式版都可用」會誤導讀者。
| 整合 | 查核狀態 | 實際含義 |
|---|---|---|
| Diffusers | PR 已合併 | 官方安裝方式指向 Git main,不是舊標籤版 |
| ComfyUI | PR 已合併 | main 有原生節點與工作流;桌面打包更新另計 |
| SGLang | PR 已合併 | 需依 source 版文件部署 |
| LightX2V | PR 已合併 | 原始碼支援生圖與圖像編輯 |
| vLLM-Omni | PR 預覽、未合併 | 需 checkout 特定分支,不能當正式版能力 |
硬體也不能只看 7B。SGLang 公開的單一環境測量中,RTX 4090 要啟用文字編碼器逐層卸載,1024×1024、40 steps 約使用 22.7 GiB,耗時 18.68 秒;這能證明消費級 GPU 有一條可行路徑,卻不能外推成所有工作站的速度保證。對多數人而言,真正的門檻會是完整元件載入、offload 策略、解析度與步數,而不是模型名稱裡的參數數字。
基準分數 60.28:看起來很強,但證據還沒有閉環

這張圖最合理的讀法,是「7B 視覺生成核心在 Qwen 自家評測中表現有競爭力」,而不是「7B 已全面擊敗大型閉源模型」。發布材料提供的是聚合分數;判分器、提示詞集合與榜單本身都由 Qwen 團隊建立。沒有獨立重現以前,60.28 可以當成值得測試的訊號,不能當成品質已被外部驗證的結論。
社群熱度也一樣。截至台北時間 2026 年 9 月 21 日 06:20,Hacker News 討論串的官方 API 快照來到 426 分、145 則後續回覆;數字在查核期間仍快速變動。它證明「透明素材+本地權重」碰到真實需求,不證明每一項品質宣稱都已站穩。
最大誤會:權重下載得到,不等於開源可商用
“FOR NON-COMMERCIAL PURPOSES ONLY.”
中文:僅限非商業用途。
Qwen Research License
這是整次發布最需要被放大的句子。授權把 Non-Commercial 明確定義為僅限研究或評估,不是「只要沒有收錢就行」。商業使用者必須另外向 Qwen 申請並取得商用授權;公開文件提供聯絡方式,沒有公開價格、條款或核准保證。
因此,本文選擇稱它為「公開可下載權重、採非商用研究授權」,而不直接稱為開源模型。OSI 的 Open Source AI Definition要求使用者能為任何目的使用系統;限制商業用途的條款不符合這個核心原則。Qwen 的發布用語描述了「拿得到權重」,授權文件才決定「你被允許拿它做什麼」。
我的判斷:這是工作流程更新,不是免費商用捷徑
我同意 Qwen 對原生透明度重要性的判斷。alpha 若能和顏色、形狀一起生成,圖像模型就從「交付一張完成圖」往「交付可重組資產」走了一步。這對設計系統、素材庫與自動化版型,比單純多幾分 benchmark 更有長期價值。
但我不接受兩個捷徑式結論。第一,7B 不等於完整管線輕巧;33GB 權重、8B 編碼器與實際顯存數字都提醒我們,compact 是相對說法。第二,Day-0 有整合不等於 production-ready;source branch、打包版、參考圖上限和 API 形狀,現在仍會因後端而異。
更關鍵的是授權。對研究者而言,公開權重讓架構、alpha 輸出與編輯流程能被檢查;對商業團隊而言,它不是 Apache、MIT 或其他可直接投入產品的寬鬆授權。這不是文字遊戲,而是決定能否上線、能否收費、能否把衍生系統交付客戶的產品條件。
現在該怎麼用 Qwen-Image-2.1?
- 研究與評估:先固定 repo commit 與後端版本,做一組最小 RGBA 測試。把同一批輸出放在黑、白、彩色背景上,檢查半透明邊緣與主體穿孔。
- 設計流程評估:不要只看官方精選圖。用自己的 logo、玻璃、髮絲、陰影與十張參考素材壓測,分別記錄主體保真、alpha 邊界與未編輯區域漂移。
- 工程部署:把解析度、steps、參考圖數、offload 策略、峰值顯存與延遲一起量;同時確認你使用的整合究竟是 tagged release、main,還是未合併 PR。
- 任何商業用途:先停在評估階段,取得並審閱另外的商用授權,再決定是否納入產品。不要把「權重可下載」當成授權完成。
結論:透明能力是真的,開放程度要看授權
Qwen-Image-2.1 最有價值的地方,是把透明圖從後處理選項提升為模型原生資料格式,並把多參考圖與局部編輯放進同一套系統。官方素材與外部框架整合足以證明這條技術路徑已經能跑;至於品質是否穩定、十張素材是否都能可靠融合、各種硬體是否划算,仍要交給實際工作負載回答。
而在「開源」這件事上,判斷可以很乾脆:看授權,不看發布稿形容詞。這次是可公開下載的研究權重,不是可自由商用的開源授權。能力值得測,產品決策則必須把那條界線畫清楚。
接著閱讀
左右滑動查看更多推薦
一句話決策:若目的是研究原生 alpha,Qwen-Image-2.1 已值得建立測試集;若目的是把功能賣給客戶,第一個動作不是下載權重,而是先取得商用授權。






