跳到主要內容

【2026 最新】Qwen-Image 2.1 ComfyUI 教學:8/16/24GB 顯卡選擇+透明 PNG 與局部編輯

最後更新: ·
Qwen-Image 2.1 ComfyUI 教學:8/16/24GB 顯卡、透明 PNG 與可重跑編輯

你下載了 Qwen-Image 2.1,打開 ComfyUI 卻看不到節點;好不容易跑出一張「棋盤格背景」圖片,又不知道那究竟是真 alpha,還是模型把棋盤格畫進圖裡。這篇 Qwen-Image 2.1 ComfyUI 教學就是為這三個現實問題而寫:版本要多新、8/16/24GB 顯卡該選哪組權重,以及怎麼交付可重跑的透明 PNG 與局部編輯。

這不是速度排行榜,也不是另一篇發布摘要。本文以 2026 年 9 月 22 日的ComfyUI v0.37.0 穩定版、官方工作流模板與 Comfy-Org 權重包為基準,專為第一次碰本地圖像工作流的讀者寫。AlphaLab 沒有把社群單機成績包裝成自家實測;硬體分流是保守的操作起點,不是官方最低規格或速度保證。

如果你想先理解模型為什麼能輸出 RGBA、完整權重為何不只「7B」,可先讀Qwen-Image 2.1 原生透明圖與授權解析;這一篇只做一件事:把它變成能驗收、能重跑、能交接的 ComfyUI 資產流程。

先說結論:低摩擦的起點不是把所有檔案都下載

  • 版本:截至 2026 年 9 月 22 日,穩定版 v0.37.0 已內建 Qwen-Image 2.1 與 templates v0.11.66,不必為了基本工作流追 development commit。
  • 權重:16GB 先照官方模板用 INT8 DiT+INT8 text encoder+BF16 VAE;8GB 才考慮把 encoder 換成模型包裡的 W4A8,並接受大量 offload;24GB 可試 BF16 DiT+INT8 encoder,但不是整套 BF16 常駐。
  • 透明圖:一定存 PNG,檢查 alpha 通道,再把同一張圖放到黑、白、彩色背景上看邊緣。
  • 可重跑:固定 ComfyUI 版本、三個模型檔名、workflow、輸入順序、尺寸與 seed;只保存成品圖還不夠。

本文的錨點公式:可重跑成品 = 固定版本+固定權重+固定 workflow+固定 seed+alpha 驗收。少任何一項,都比較像一次性的漂亮結果,不像可交付資產。

一、Qwen-Image 2.1 ComfyUI 教學的版本基線

發布第一天有人找不到 default workflow,是因為當時的穩定版仍落後主線;現在情況已不同。ComfyUI v0.37.0 的 release note 明列 Qwen-Image 2.1,模板索引也把最低版本寫成 0.37.0。原生 v0.36 不符合這份模板的最低版本;遇到缺節點時,先檢查 core 與 requirements,但不能只憑版本就排除權重檔或路徑問題。

先更新,再匯入 workflow

  • ComfyUI Desktop:從 Manage/Update 選 Stable。
  • Windows Portable:執行 update/update_comfyui_stable.bat
  • Git 手動安裝:日常更新依序執行 git pullpip install -r requirements.txt,再重啟 python main.py。若要把可重跑環境精確鎖在此版本,先 git fetch --tags,再 git checkout v0.37.0 並記錄版本。

不要只做 git pull 就停手;模板與前端套件也會透過 requirements 更新。完整方式以ComfyUI 官方更新文件為準。若你平常靠大量 custom nodes,第一次先用乾淨環境或 --disable-all-custom-nodes 排除舊節點衝突。

二、8/16/24GB 顯卡怎麼選?

Qwen-Image 2.1 在 8GB、16GB、24GB 顯卡的權重選擇與下載容量路線圖
這是風險分流,不是官方相容矩陣。檔案總量代表下載與儲存,不等於推理時同時占用的 VRAM。

Comfy-Org 官方模型包目前提供兩個 DiT、三個 Qwen3-VL encoder 與一個 VAE。INT8 DiT 約 7.26 GB、INT8 encoder 約 9.35 GB、W4A8 encoder 約 6.31 GB、BF16 DiT 約 14.23 GB、VAE 約 0.68 GB。這些是十進位檔案容量,不是顯存門檻。

8GB:依檔案大小推導的嘗試路線

從 INT8 DiT+W4A8 encoder+BF16 VAE、batch 1、約 1MP、單一參考圖開始,三檔共約 14.24 GB。W4A8 在官方模型包裡,但不是官方模板預設;如果載入失敗,先降解析度、關閉占用 GPU 的程式。編輯模板的實驗性 QwenImage21Cache 可設 device=cpu, dtype=int8,或用 device=off 每步重算 prefix;仍然 OOM 時才把 --novram 當低記憶體後備。系統 RAM 要保留多少,仍要依平台與工作負載量測。

16GB:先完全照官方 INT8 三件套

INT8 DiT+INT8 encoder+BF16 VAE 合計約 17.28 GB(16.10 GiB),也是官方模板的預設組合。ComfyUI 具備分段載入與 offload 機制,但這個檔案總量不能證明任一 16GB 環境一定能完成推理。第一輪不要追 2K、多張參考圖或 40 steps;先嘗試 1024×1024、25 steps、單張輸入。

24GB:把 BF16 DiT 當成精度 A/B 路線

BF16 DiT+INT8 encoder+VAE 的檔案量約 24.26 GB,可作為較高精度權重的 A/B 實驗路線;是否改善,必須固定 seed、輸入與其他參數比較。完整 BF16 三件套約 32.44 GB(30.21 GiB),尚未計入 activation 與 cache,因此 24GB 顯卡也不該被描述成「全套常駐」。截至 2026 年 9 月 22 日,本文查閱的 Qwen model card、Comfy-Org model card 與 v0.11.66 模板未列 8/16/24GB 的逐級品質矩陣;不能把量化差異說成肉眼必然可見或完全無損。若你還在建立本地顯存觀念,可搭配本地 AI 顯存規劃指南

三、下載三個檔案,放進正確資料夾

ComfyUI/models/diffusion_models/qwen_image_2.1_int8_convrot.safetensors
ComfyUI/models/text_encoders/qwen3vl_8b_int8_convrot.safetensors
ComfyUI/models/vae/qwen_image_2.1_vae_bf16.safetensors

新手先只下載這三個。不要把整個 70GB 以上的模型 repository 全部抓下來,也不要把 Qwen3.5 的 pe_t2ipe_i2i 檔案誤當基本模板必需品;截至本文查核時,三份官方工作流仍接 Qwen3-VL 8B。放好檔案後重啟 ComfyUI,讓下拉選單重新掃描。

若要讓別人驗證下載內容,除了檔名,也記完整 SHA-256:INT8 DiT 是 cb74113cb03faecd79611b01fd7fd642f0aa60d6f0b95086abee214d75eaa57d、INT8 encoder 是 8bfd0f6e12abf2d2d697ecc888e5e90b0d6741d6708f05799f53afa560452e8f、VAE 是 bb21f7473051e1ac368515dd3f2e15cd44d7a11748ee8823e1ddca3e4876b7c9。這三筆綁定本文使用的 Comfy-Org model pack revision ace0edeb3791a594ddfa36ed5f41a178a394e921

接著從內建 Templates 開啟 Qwen Image 2.1 的 Text to Image、Image Edit 或 Background Removal;也可以下載固定在 commit 371a7b7171bbd11e9cc92ef615ba5ad223d7e5b4官方 T2I JSON官方 Edit JSON。本文使用的模板版本是 v0.11.66;若未來模板更新,先另存舊 JSON,再比較節點差異。

四、Qwen-Image 2.1 ComfyUI 教學:透明 PNG 生成與驗收

官方 T2I 模板的基準是 1024×1024、25 steps、CFG 1、Euler/simple、PNG 8-bit sRGB。先保留這組設定;CFG 1 時 negative prompt 不參與結果,因此不要一開始就花時間堆負面提示詞。要生成透明素材,把主體描述放進官方模板使用的 RGBA 句型:

This is an RGBA format image with transparency. A single blue ceramic robot, centered, soft studio light. The image has an alpha channel and a transparent background.

提示詞只是要求,不是驗收證據。輸出必須是 PNG;JPEG 沒有 alpha。你至少要確認檔案通道不是單純 RGB;只要 minima.a < 1,檔案裡就存在透明像素。對一般去背素材,才會進一步期待最小值接近 0、最大值接近 1;均勻半透明圖則可能有相同的最小值與最大值。若電腦已有 ImageMagick,可用:

magick identify -format '%[channels] %[fx:minima.a] %[fx:maxima.a]\n' output.png

上面的單引號可用於 macOS/Linux shell 與 PowerShell;若在 Windows cmd.exe 執行,請把格式字串改用雙引號。

Qwen-Image 2.1 官方去背樣本在棋盤格、白底、黑底與 alpha 通道的驗收圖
用 Comfy-Org 官方 Background Removal 範例示範驗收:同一個 RGBA 輸出放上棋盤格、白底與黑底,再看 alpha 灰階。這是官方樣本檔檢查,不是 AlphaLab 本機推理實測。

視覺上再檢查四件事:外輪廓有沒有白邊或黑邊、髮絲與半透明材質是否被硬切、主體內部是否被挖洞、背景顏色是否滲進邊緣。若只需要傳統高品質去背,不一定要讓大型生成模型重畫整張;MultiMatte 本地去背教學更適合做邊界修整與對照組。

五、局部編輯怎麼做到可重跑?

  1. 固定來源:把原圖放在 image_1;第二張起才是參考圖。提示中以 <image1><image2> 指名,不靠「左邊那張」之類含糊說法。
  2. 先跟原尺寸:第一輪讓 custom_size=false,避免同時改內容與畫布。若必須指定尺寸,使用 32 的倍數並記錄數值。
  3. 一次改一件事:例如「只把 <image1> 的杯子改成藍色,人物、手部、桌面與光線保持不變」。每一輪都從原始圖出發,減少多代重繪累積漂移。
  4. 固定 seed:官方 Edit 模板內層 KSampler 預設是 randomize。進入/unpack subgraph,把 control after generate 改成 fixed,抄下 seed。T2I 模板則已是 fixed。
  5. 比對未改區:不要只看目標物有沒有變。把輸入與輸出疊圖,檢查臉、手、文字、邊界與光線是否意外漂移。
  6. 保留收據:保存輸出 PNG、workflow JSON、原始輸入、prompt、seed、尺寸、steps、sampler、scheduler、三個權重 SHA-256、模板 commit 與 ComfyUI 版本。
Qwen-Image 2.1 ComfyUI 可重跑工作流的六步交付流程圖
同 seed 只有在軟體、權重、backend、輸入與參數也固定時才有比較意義;更新 PyTorch、attention kernel 或 scheduler 仍可能造成數值差異。

ComfyUI 會把 workflow metadata 寫進支援的 PNG,日後可拖回介面還原 graph;但團隊交付仍應另外保存 JSON 與文字紀錄,避免平台清除 metadata。這個「提示詞+工作流+輸出資產」思路,也能延伸到GPT Image 2 的 prompt-as-code可編輯 AI 海報工作流

六、跑不動或跑歪時,用這個順序排錯

  1. 找不到模板/節點:確認 v0.37.0、requirements 已更新並重新啟動;先關掉 custom nodes 對照。
  2. 模型下拉選單是空的:逐字核對三個目錄與檔名,不要把 text encoder 放進 checkpoints。
  3. OOM:先回到 batch 1、1MP、單張參考圖;再關閉 cache 或把 cache 移到 CPU,最後才用 --novram。一次只改一個變因。
  4. 輸出全是噪點:先確認 encoder 是 Qwen3-VL 8B 版本,而不是來源不明的 Qwen3.5/GGUF 組合;重新載入官方 JSON。
  5. 透明圖其實不透明:確認 Save 節點輸出 PNG,檢查 alpha extrema,再用黑白底合成,不要只信 UI 棋盤格。

以下列出三個截至 2026 年 9 月 22 日、與本文編輯流程直接相關的使用者回報,並不是完整 issue 清單。第一,ComfyUI 官方 repository 的單一 MPS 回報指出 reference-image VAE encode 失真,該環境以 --cpu-vae 改善;這不等於所有 Mac 都不能生成。第二,1024 reference grid 噪點回報仍是開放狀態;原回報者在該配置中認為 992 或 1056 較乾淨,可拿來做診斷對照,但不是已確認的通用修正。第三,高解析度 scheduler 差異回報質疑固定 shift 與上游 dynamic shifting 在 2K/4MP 時的差距;尚未定案前,不要把 ComfyUI 高解析度輸出視為已和上游完全對齊。

七、授權與成本:跑得動,不代表可以直接接商案

Qwen-Image 2.1 權重採 Qwen Research License;條款把非商業用途限於研究或評估,使用模型 Materials 做商業用途需要另取得商業授權。不要把「可下載」寫成 Apache/MIT 式自由商用。若你準備把這套流程用在客戶交付、付費服務或產品功能,先完成授權審閱,再談部署。

運算成本也不只有 VRAM。8GB 路線會把等待轉移到 CPU、RAM 與磁碟;多參考圖與 2K 會增加記憶體壓力,40 steps 則主要增加運算時間。較省硬體升級成本的做法,是先用一組 1MP 驗收集找出可接受的權重與參數,而不是一開始就升級所有硬體。若你想系統化學 AI 工具與工作流,可從 AlphaLab 的線上課程AI 文章專區繼續。

常見問題 FAQ

1. 8GB 顯卡一定能跑 Qwen-Image 2.1 嗎?

不能保證。截至 2026 年 9 月 22 日,本文查閱的 Qwen model card、Comfy-Org model card 與 v0.11.66 模板未列 8GB 最低需求。INT8 DiT+W4A8 encoder、1MP、batch 1 是依檔案大小設計的嘗試路線,仍會受 GPU backend、系統 RAM、參考圖與 offload 影響。

2. 一定要更新到 latest commit 嗎?

基本工作流不用。穩定版 v0.37.0 已包含原生支援與 templates v0.11.66。只有追蹤尚未發布的修正時,才考慮 development branch,並另存環境版本。

3. 匯入 workflow 後紅色節點怎麼辦?

先更新 core 與 requirements,再重啟。若仍缺節點,用乾淨環境載入官方 JSON;不要先安裝來源不明的同名 custom node。

4. 有棋盤格就代表是真透明嗎?

不代表。棋盤格可能只是檢視器背景,也可能被畫進 RGB。用上面的 ImageMagick 指令時,要確認 PNG 有 alpha;若 minima.a < 1,代表至少存在透明像素,若最小值與最大值都等於 1,就是全不透明。最後仍要依素材目的在黑白底檢查邊緣。

5. 為什麼 negative prompt 沒有效果?

官方模板預設 CFG 1,negative prompt 不會參與。先把正向提示寫清楚;不要為了硬套負面提示而任意提高 CFG,除非你保留固定 seed 做 A/B 比較。

6. 同一個 seed 為什麼還是不一樣?

seed 只是其中一項。模型 SHA、ComfyUI/PyTorch 版本、sampler、scheduler、attention backend、尺寸、輸入順序與工作流都要一致;Edit 模板還要把 randomize 改為 fixed。

7. Mac 可以做局部編輯嗎?

可以嘗試,但要做 encode/decode 對照。目前有一份 MPS reference encode 失真回報,該回報以 --cpu-vae 改善。它是範圍性 issue,不應被泛化成所有 Mac 都失效。

8. 生成的透明 PNG 可以商用嗎?

不能只看檔案格式下結論。目前模型 Materials 是研究/評估授權,商業流程需另取授權;成品還可能涉及輸入素材、商標、肖像與其他權利。產品使用前應針對你的情境審閱條款。

給新手的 7 個重點

  1. 先固定 v0.37.0,不要把 day-one 的 latest-commit 建議照搬到今天。
  2. 只下載 DiT、Qwen3-VL encoder、RGBA VAE 三個必要檔案。
  3. 16GB 先用官方 INT8 三件套;8GB 與 24GB 都是調整路線,不是保證級別。
  4. 第一輪用 1MP、25 steps、CFG 1、Euler/simple。
  5. 透明度要驗 alpha extrema,再看黑白底與邊緣。
  6. 局部編輯要固定 seed、輸入順序與原始圖,每輪只改一件事。
  7. 交付 PNG+workflow JSON+環境紀錄,商用前另行確認授權。

接著閱讀

左右滑動查看更多推薦

結語:先做一份能被別人重跑的透明資產

這份 Qwen-Image 2.1 ComfyUI 教學的成功標準,不是截一張漂亮成品,而是另一個人拿到你的 PNG、JSON、輸入與版本紀錄後,能理解它怎麼產生、能重跑局部修改,也能在黑白底驗收 alpha。

一句話決策:16GB 從官方 INT8 三件套開始,與模板差異最少;8GB 把 W4A8 與 offload 當嘗試,24GB 若換 BF16 DiT,先固定 seed 做 A/B。無論哪條路,先固定 1MP 基準與 seed,再逐項增加解析度、參考圖和品質設定——你要優化的是一條可重跑的流程,不是一張碰巧成功的圖。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。