你下載了 Qwen-Image 2.1,打開 ComfyUI 卻看不到節點;好不容易跑出一張「棋盤格背景」圖片,又不知道那究竟是真 alpha,還是模型把棋盤格畫進圖裡。這篇 Qwen-Image 2.1 ComfyUI 教學就是為這三個現實問題而寫:版本要多新、8/16/24GB 顯卡該選哪組權重,以及怎麼交付可重跑的透明 PNG 與局部編輯。
這不是速度排行榜,也不是另一篇發布摘要。本文以 2026 年 9 月 22 日的ComfyUI v0.37.0 穩定版、官方工作流模板與 Comfy-Org 權重包為基準,專為第一次碰本地圖像工作流的讀者寫。AlphaLab 沒有把社群單機成績包裝成自家實測;硬體分流是保守的操作起點,不是官方最低規格或速度保證。
如果你想先理解模型為什麼能輸出 RGBA、完整權重為何不只「7B」,可先讀Qwen-Image 2.1 原生透明圖與授權解析;這一篇只做一件事:把它變成能驗收、能重跑、能交接的 ComfyUI 資產流程。
先說結論:低摩擦的起點不是把所有檔案都下載
- 版本:截至 2026 年 9 月 22 日,穩定版 v0.37.0 已內建 Qwen-Image 2.1 與 templates v0.11.66,不必為了基本工作流追 development commit。
- 權重:16GB 先照官方模板用 INT8 DiT+INT8 text encoder+BF16 VAE;8GB 才考慮把 encoder 換成模型包裡的 W4A8,並接受大量 offload;24GB 可試 BF16 DiT+INT8 encoder,但不是整套 BF16 常駐。
- 透明圖:一定存 PNG,檢查 alpha 通道,再把同一張圖放到黑、白、彩色背景上看邊緣。
- 可重跑:固定 ComfyUI 版本、三個模型檔名、workflow、輸入順序、尺寸與 seed;只保存成品圖還不夠。
本文的錨點公式:可重跑成品 = 固定版本+固定權重+固定 workflow+固定 seed+alpha 驗收。少任何一項,都比較像一次性的漂亮結果,不像可交付資產。
一、Qwen-Image 2.1 ComfyUI 教學的版本基線
發布第一天有人找不到 default workflow,是因為當時的穩定版仍落後主線;現在情況已不同。ComfyUI v0.37.0 的 release note 明列 Qwen-Image 2.1,模板索引也把最低版本寫成 0.37.0。原生 v0.36 不符合這份模板的最低版本;遇到缺節點時,先檢查 core 與 requirements,但不能只憑版本就排除權重檔或路徑問題。
先更新,再匯入 workflow
- ComfyUI Desktop:從 Manage/Update 選 Stable。
- Windows Portable:執行
update/update_comfyui_stable.bat。 - Git 手動安裝:日常更新依序執行
git pull、pip install -r requirements.txt,再重啟python main.py。若要把可重跑環境精確鎖在此版本,先git fetch --tags,再git checkout v0.37.0並記錄版本。
不要只做 git pull 就停手;模板與前端套件也會透過 requirements 更新。完整方式以ComfyUI 官方更新文件為準。若你平常靠大量 custom nodes,第一次先用乾淨環境或 --disable-all-custom-nodes 排除舊節點衝突。
二、8/16/24GB 顯卡怎麼選?

Comfy-Org 官方模型包目前提供兩個 DiT、三個 Qwen3-VL encoder 與一個 VAE。INT8 DiT 約 7.26 GB、INT8 encoder 約 9.35 GB、W4A8 encoder 約 6.31 GB、BF16 DiT 約 14.23 GB、VAE 約 0.68 GB。這些是十進位檔案容量,不是顯存門檻。
8GB:依檔案大小推導的嘗試路線
從 INT8 DiT+W4A8 encoder+BF16 VAE、batch 1、約 1MP、單一參考圖開始,三檔共約 14.24 GB。W4A8 在官方模型包裡,但不是官方模板預設;如果載入失敗,先降解析度、關閉占用 GPU 的程式。編輯模板的實驗性 QwenImage21Cache 可設 device=cpu, dtype=int8,或用 device=off 每步重算 prefix;仍然 OOM 時才把 --novram 當低記憶體後備。系統 RAM 要保留多少,仍要依平台與工作負載量測。
16GB:先完全照官方 INT8 三件套
INT8 DiT+INT8 encoder+BF16 VAE 合計約 17.28 GB(16.10 GiB),也是官方模板的預設組合。ComfyUI 具備分段載入與 offload 機制,但這個檔案總量不能證明任一 16GB 環境一定能完成推理。第一輪不要追 2K、多張參考圖或 40 steps;先嘗試 1024×1024、25 steps、單張輸入。
24GB:把 BF16 DiT 當成精度 A/B 路線
BF16 DiT+INT8 encoder+VAE 的檔案量約 24.26 GB,可作為較高精度權重的 A/B 實驗路線;是否改善,必須固定 seed、輸入與其他參數比較。完整 BF16 三件套約 32.44 GB(30.21 GiB),尚未計入 activation 與 cache,因此 24GB 顯卡也不該被描述成「全套常駐」。截至 2026 年 9 月 22 日,本文查閱的 Qwen model card、Comfy-Org model card 與 v0.11.66 模板未列 8/16/24GB 的逐級品質矩陣;不能把量化差異說成肉眼必然可見或完全無損。若你還在建立本地顯存觀念,可搭配本地 AI 顯存規劃指南。
三、下載三個檔案,放進正確資料夾
ComfyUI/models/diffusion_models/qwen_image_2.1_int8_convrot.safetensors
ComfyUI/models/text_encoders/qwen3vl_8b_int8_convrot.safetensors
ComfyUI/models/vae/qwen_image_2.1_vae_bf16.safetensors
新手先只下載這三個。不要把整個 70GB 以上的模型 repository 全部抓下來,也不要把 Qwen3.5 的 pe_t2i/pe_i2i 檔案誤當基本模板必需品;截至本文查核時,三份官方工作流仍接 Qwen3-VL 8B。放好檔案後重啟 ComfyUI,讓下拉選單重新掃描。
若要讓別人驗證下載內容,除了檔名,也記完整 SHA-256:INT8 DiT 是 cb74113cb03faecd79611b01fd7fd642f0aa60d6f0b95086abee214d75eaa57d、INT8 encoder 是 8bfd0f6e12abf2d2d697ecc888e5e90b0d6741d6708f05799f53afa560452e8f、VAE 是 bb21f7473051e1ac368515dd3f2e15cd44d7a11748ee8823e1ddca3e4876b7c9。這三筆綁定本文使用的 Comfy-Org model pack revision ace0edeb3791a594ddfa36ed5f41a178a394e921。
接著從內建 Templates 開啟 Qwen Image 2.1 的 Text to Image、Image Edit 或 Background Removal;也可以下載固定在 commit 371a7b7171bbd11e9cc92ef615ba5ad223d7e5b4 的官方 T2I JSON與官方 Edit JSON。本文使用的模板版本是 v0.11.66;若未來模板更新,先另存舊 JSON,再比較節點差異。
四、Qwen-Image 2.1 ComfyUI 教學:透明 PNG 生成與驗收
官方 T2I 模板的基準是 1024×1024、25 steps、CFG 1、Euler/simple、PNG 8-bit sRGB。先保留這組設定;CFG 1 時 negative prompt 不參與結果,因此不要一開始就花時間堆負面提示詞。要生成透明素材,把主體描述放進官方模板使用的 RGBA 句型:
This is an RGBA format image with transparency. A single blue ceramic robot, centered, soft studio light. The image has an alpha channel and a transparent background.
提示詞只是要求,不是驗收證據。輸出必須是 PNG;JPEG 沒有 alpha。你至少要確認檔案通道不是單純 RGB;只要 minima.a < 1,檔案裡就存在透明像素。對一般去背素材,才會進一步期待最小值接近 0、最大值接近 1;均勻半透明圖則可能有相同的最小值與最大值。若電腦已有 ImageMagick,可用:
magick identify -format '%[channels] %[fx:minima.a] %[fx:maxima.a]\n' output.png
上面的單引號可用於 macOS/Linux shell 與 PowerShell;若在 Windows cmd.exe 執行,請把格式字串改用雙引號。

視覺上再檢查四件事:外輪廓有沒有白邊或黑邊、髮絲與半透明材質是否被硬切、主體內部是否被挖洞、背景顏色是否滲進邊緣。若只需要傳統高品質去背,不一定要讓大型生成模型重畫整張;MultiMatte 本地去背教學更適合做邊界修整與對照組。
五、局部編輯怎麼做到可重跑?
- 固定來源:把原圖放在
image_1;第二張起才是參考圖。提示中以<image1>、<image2>指名,不靠「左邊那張」之類含糊說法。 - 先跟原尺寸:第一輪讓
custom_size=false,避免同時改內容與畫布。若必須指定尺寸,使用 32 的倍數並記錄數值。 - 一次改一件事:例如「只把 <image1> 的杯子改成藍色,人物、手部、桌面與光線保持不變」。每一輪都從原始圖出發,減少多代重繪累積漂移。
- 固定 seed:官方 Edit 模板內層 KSampler 預設是 randomize。進入/unpack subgraph,把 control after generate 改成 fixed,抄下 seed。T2I 模板則已是 fixed。
- 比對未改區:不要只看目標物有沒有變。把輸入與輸出疊圖,檢查臉、手、文字、邊界與光線是否意外漂移。
- 保留收據:保存輸出 PNG、workflow JSON、原始輸入、prompt、seed、尺寸、steps、sampler、scheduler、三個權重 SHA-256、模板 commit 與 ComfyUI 版本。

ComfyUI 會把 workflow metadata 寫進支援的 PNG,日後可拖回介面還原 graph;但團隊交付仍應另外保存 JSON 與文字紀錄,避免平台清除 metadata。這個「提示詞+工作流+輸出資產」思路,也能延伸到GPT Image 2 的 prompt-as-code與可編輯 AI 海報工作流。
六、跑不動或跑歪時,用這個順序排錯
- 找不到模板/節點:確認 v0.37.0、requirements 已更新並重新啟動;先關掉 custom nodes 對照。
- 模型下拉選單是空的:逐字核對三個目錄與檔名,不要把 text encoder 放進 checkpoints。
- OOM:先回到 batch 1、1MP、單張參考圖;再關閉 cache 或把 cache 移到 CPU,最後才用
--novram。一次只改一個變因。 - 輸出全是噪點:先確認 encoder 是 Qwen3-VL 8B 版本,而不是來源不明的 Qwen3.5/GGUF 組合;重新載入官方 JSON。
- 透明圖其實不透明:確認 Save 節點輸出 PNG,檢查 alpha extrema,再用黑白底合成,不要只信 UI 棋盤格。
以下列出三個截至 2026 年 9 月 22 日、與本文編輯流程直接相關的使用者回報,並不是完整 issue 清單。第一,ComfyUI 官方 repository 的單一 MPS 回報指出 reference-image VAE encode 失真,該環境以 --cpu-vae 改善;這不等於所有 Mac 都不能生成。第二,1024 reference grid 噪點回報仍是開放狀態;原回報者在該配置中認為 992 或 1056 較乾淨,可拿來做診斷對照,但不是已確認的通用修正。第三,高解析度 scheduler 差異回報質疑固定 shift 與上游 dynamic shifting 在 2K/4MP 時的差距;尚未定案前,不要把 ComfyUI 高解析度輸出視為已和上游完全對齊。
七、授權與成本:跑得動,不代表可以直接接商案
Qwen-Image 2.1 權重採 Qwen Research License;條款把非商業用途限於研究或評估,使用模型 Materials 做商業用途需要另取得商業授權。不要把「可下載」寫成 Apache/MIT 式自由商用。若你準備把這套流程用在客戶交付、付費服務或產品功能,先完成授權審閱,再談部署。
運算成本也不只有 VRAM。8GB 路線會把等待轉移到 CPU、RAM 與磁碟;多參考圖與 2K 會增加記憶體壓力,40 steps 則主要增加運算時間。較省硬體升級成本的做法,是先用一組 1MP 驗收集找出可接受的權重與參數,而不是一開始就升級所有硬體。若你想系統化學 AI 工具與工作流,可從 AlphaLab 的線上課程與AI 文章專區繼續。
常見問題 FAQ
1. 8GB 顯卡一定能跑 Qwen-Image 2.1 嗎?
不能保證。截至 2026 年 9 月 22 日,本文查閱的 Qwen model card、Comfy-Org model card 與 v0.11.66 模板未列 8GB 最低需求。INT8 DiT+W4A8 encoder、1MP、batch 1 是依檔案大小設計的嘗試路線,仍會受 GPU backend、系統 RAM、參考圖與 offload 影響。
2. 一定要更新到 latest commit 嗎?
基本工作流不用。穩定版 v0.37.0 已包含原生支援與 templates v0.11.66。只有追蹤尚未發布的修正時,才考慮 development branch,並另存環境版本。
3. 匯入 workflow 後紅色節點怎麼辦?
先更新 core 與 requirements,再重啟。若仍缺節點,用乾淨環境載入官方 JSON;不要先安裝來源不明的同名 custom node。
4. 有棋盤格就代表是真透明嗎?
不代表。棋盤格可能只是檢視器背景,也可能被畫進 RGB。用上面的 ImageMagick 指令時,要確認 PNG 有 alpha;若 minima.a < 1,代表至少存在透明像素,若最小值與最大值都等於 1,就是全不透明。最後仍要依素材目的在黑白底檢查邊緣。
5. 為什麼 negative prompt 沒有效果?
官方模板預設 CFG 1,negative prompt 不會參與。先把正向提示寫清楚;不要為了硬套負面提示而任意提高 CFG,除非你保留固定 seed 做 A/B 比較。
6. 同一個 seed 為什麼還是不一樣?
seed 只是其中一項。模型 SHA、ComfyUI/PyTorch 版本、sampler、scheduler、attention backend、尺寸、輸入順序與工作流都要一致;Edit 模板還要把 randomize 改為 fixed。
7. Mac 可以做局部編輯嗎?
可以嘗試,但要做 encode/decode 對照。目前有一份 MPS reference encode 失真回報,該回報以 --cpu-vae 改善。它是範圍性 issue,不應被泛化成所有 Mac 都失效。
8. 生成的透明 PNG 可以商用嗎?
不能只看檔案格式下結論。目前模型 Materials 是研究/評估授權,商業流程需另取授權;成品還可能涉及輸入素材、商標、肖像與其他權利。產品使用前應針對你的情境審閱條款。
給新手的 7 個重點
- 先固定 v0.37.0,不要把 day-one 的 latest-commit 建議照搬到今天。
- 只下載 DiT、Qwen3-VL encoder、RGBA VAE 三個必要檔案。
- 16GB 先用官方 INT8 三件套;8GB 與 24GB 都是調整路線,不是保證級別。
- 第一輪用 1MP、25 steps、CFG 1、Euler/simple。
- 透明度要驗 alpha extrema,再看黑白底與邊緣。
- 局部編輯要固定 seed、輸入順序與原始圖,每輪只改一件事。
- 交付 PNG+workflow JSON+環境紀錄,商用前另行確認授權。
接著閱讀
左右滑動查看更多推薦
結語:先做一份能被別人重跑的透明資產
這份 Qwen-Image 2.1 ComfyUI 教學的成功標準,不是截一張漂亮成品,而是另一個人拿到你的 PNG、JSON、輸入與版本紀錄後,能理解它怎麼產生、能重跑局部修改,也能在黑白底驗收 alpha。
一句話決策:16GB 從官方 INT8 三件套開始,與模板差異最少;8GB 把 W4A8 與 offload 當嘗試,24GB 若換 BF16 DiT,先固定 seed 做 A/B。無論哪條路,先固定 1MP 基準與 seed,再逐項增加解析度、參考圖和品質設定——你要優化的是一條可重跑的流程,不是一張碰巧成功的圖。






