LLaDA-Image 本機生成真正難的不是把模型名稱背起來,而是先把三個不同選擇拆開:Base 或 Turbo 決定推理步數與取捨,BF16 或 FP8 決定權重格式,官方 Python 或社群 ComfyUI 則決定操作入口。本文依 2026 年 9 月 5 日可取得的官方程式、模型快照與論文,帶你從環境檢查、第一張圖、參考圖改圖,一路做到固定題目的 Base/Turbo 驗收。
先說清楚證據邊界:這篇不把尚未在 AlphaLab 的 Apple M4 主機上跑過的 CUDA 結果寫成「本站測得」,也不拿模型檔大小假裝顯存需求。你會得到可複製的官方命令、精確版本、社群節點的隔離裝法,以及一套能在自己的顯卡上記錄時間、峰值顯存與畫面一致性的驗收方法。
LLaDA-Image 本機流程=模型版本(Base/Turbo)+權重精度(BF16/FP8)+執行入口(官方 Python/非官方 ComfyUI)+同一套驗收題。
LLaDA-Image 本機生成先選哪個?四個名稱不是四種能力
LLaDA-Image 是 inclusionAI 在 2026 年 9 月 4 日發布的統一圖片生成與編輯模型家族。官方把核心描述為 6B 參數的 Diffusion Transformer(用 Transformer 逐步去除雜訊的影像模型),並讓同一個 checkpoint 處理文字生圖、VQ 條件生成與參考圖編輯。官方程式碼快照建議 Base 跑 50 steps、CFG 5.0;蒸餾後的 Turbo 跑 4 steps、CFG 1.0。

最容易混淆的是:Turbo 不是 FP8,Base 也不等於 BF16。前者是推理版本,後者是權重精度。官方 model zoo 一共列出 Base BF16、Base FP8、Turbo BF16、Turbo FP8 四個 Hugging Face 模型庫。按照 2026 年 9 月 5 日各庫檔案清單加總,兩個 BF16 庫各約 49.3 GB,兩個 FP8 庫各約 27.6 GB;這是模型庫下載量,不是執行時顯存門檻。
- 想先確認流程會動:從 Turbo 開始,4 steps 能縮短每次除錯等待。
- 想比較最終畫質或改圖保真:再加入 Base,以同一 prompt、尺寸與 seed 跑 50 steps。
- 硬碟空間或下載時間敏感:先看官方 FP8;不要因此直接推論顯存必然減到某個數字。
- 偏好節點介面:把 ComfyUI 視為社群整合層,先在獨立副本驗證,不要跟官方支援混為一談。
LLaDA-Image 本機生成前先檢查:CUDA、硬碟與版本
截至 2026 年 9 月 5 日,釘選的官方 README 記載已使用 Python 3.11、PyTorch 2.8、Transformers 4.57.6、Diffusers 0.39.0,官方執行腳本預設 DEVICE=cuda。該 README 與論文沒有列出按顯卡型號區分的最低 VRAM,也沒有提供本文能據此驗證的 Apple MPS 或 AMD 快速路徑;這只是對上述兩份指定文件的範圍描述,不代表其他社群移植不存在。
# 先留下硬體與空間快照
nvidia-smi --query-gpu=name,memory.total,driver_version --format=csv
df -h .
# 確認 Python,不要把套件裝進系統環境
python --version
conda --version

保留模型庫大小之外的餘裕,因為還有 Conda 環境、Hugging Face cache 與輸出圖片。下載前可先用 hf download inclusionAI/LLaDA-Image-Turbo-FP8 --dry-run列出待抓檔案;這是 Hugging Face CLI 官方文件提供的預覽模式。若你還不熟悉「模型參數、量化與實際記憶體」的差別,可先讀 本機模型顯存估算教學與 GGUF 量化指南。
官方 Python 路徑:先跑 Turbo FP8 的第一張圖
官方路徑最適合當基準,因為參數與生成模式直接對應上游程式。下面把程式庫固定在 commit 6bac7e7,模型固定在 Turbo FP8 快照 664a975;日後上游更新時,你仍能知道自己當時跑的是哪一組程式與權重。
git clone https://github.com/inclusionAI/LLaDA-Image.git
cd LLaDA-Image
git checkout 6bac7e7c1618e3ed9ec075ba75ff78cedfca6b38
conda create -n llada-image python=3.11 -y
conda activate llada-image
pip install -r requirements.txt
HF_REPO_ID=inclusionAI/LLaDA-Image-Turbo-FP8 \
HF_REVISION=664a975e4b4980fb750fd47b2f87e1874bb14bd7 \
STEPS=4 GUIDANCE_SCALE=1.0 SEED=42 \
bash scripts/run_llada_image.sh \
"A red enamel coffee maker on a wooden table, morning window light, product photograph"
腳本第一次會下載模型,完成後把圖片放進時間戳記資料夾 outputs/images/…/0000.png。若想改跑官方 Base BF16,把模型改成 inclusionAI/LLaDA-Image、revision 改成 e4e2703f410f7ddb6ee8d6b09dac6a8ec5093039,並把 STEPS=50、GUIDANCE_SCALE=5.0;其他 prompt、尺寸與 seed 保持不動,才能做有意義的 A/B。
怎麼把「感覺比較快」變成可比較紀錄?
在另一個終端機每秒記錄 GPU 程序的顯存,生成命令前後用 shell 的 time計時。至少保存模型 revision、GPU 名稱、驅動版本、steps、CFG、尺寸、seed、總時間與觀察到的峰值。若執行失敗,也要保留完整錯誤;「OOM 發生在哪一階段」比單寫一個顯存數字更能幫下一次調整。
# 終端機 A:每秒觀察執行中的 GPU 程序
nvidia-smi --query-compute-apps=pid,used_memory --format=csv -l 1
# 終端機 B:在原本命令前加 time
time env HF_REPO_ID=inclusionAI/LLaDA-Image-Turbo-FP8 \
HF_REVISION=664a975e4b4980fb750fd47b2f87e1874bb14bd7 \
STEPS=4 GUIDANCE_SCALE=1.0 SEED=42 \
bash scripts/run_llada_image.sh "你的固定 prompt"
參考圖改圖:不是一般 img2img 強度滑桿
官方 pipeline 的改圖入口是 generation_mode=editing,必須提供參考圖片。文字與 VQ 生成的寬高要能被 16 整除;editing 的寬高要能被 32 整除。先用 1024×1024 避開尺寸錯誤,並選擇你有權使用的圖片。
GENERATION_MODE=editing \
HF_REPO_ID=inclusionAI/LLaDA-Image-Turbo-FP8 \
HF_REVISION=664a975e4b4980fb750fd47b2f87e1874bb14bd7 \
HEIGHT=1024 WIDTH=1024 STEPS=4 GUIDANCE_SCALE=1.0 SEED=42 \
bash scripts/run_llada_image.sh \
"Change only the coffee maker from red to cobalt blue; preserve camera angle, table, lighting and every other object" \
/absolute/path/reference.png
好的驗收不是只問「漂亮嗎」,而是逐項看:指定顏色有沒有改、構圖有沒有漂移、非目標物件是否被重畫、文字是否拼對。若要測人物一致性,使用本人或已授權素材,並把髮型、衣服、姿勢、背景分開評分;2026 年 9 月 3 日版官方論文的公開評測表沒有列出直接的 Base/Turbo 人物身份一致性盲測數字,因此本文不替模型下「哪個一定更像」的結論。
ComfyUI 怎麼接?把它當成非官方、會變動的整合
截至 2026 年 9 月 5 日,inclusionAI 的釘選 repository tree 與 README 提供的是 Diffusers/Python 流程;下列節點來自 RealRebelAI 的獨立 ComfyUI 整合,其 README 也明確表示不是上游 repository。ComfyUI 官方文件提醒,自訂節點會執行第三方程式,安裝前要檢查來源與依賴;因此先複製一份乾淨環境,不要直接塞進工作中的 production graph。
cd /path/to/isolated/ComfyUI/custom_nodes
git clone https://github.com/city96/ComfyUI-GGUF.git
git -C ComfyUI-GGUF checkout 6ea2651e7df66d7585f6ffee804b20e92fb38b8a
python -m pip install -r ComfyUI-GGUF/requirements.txt
git clone https://github.com/RealRebelAI/LLaDa-Image_ComfyUI.git ComfyUI-LLaDA-Image
git -C ComfyUI-LLaDA-Image checkout 12597edf68b0e5d27842a1a970a769692e63aca9
上面的 python必須是啟動這份隔離 ComfyUI 的同一個直譯器;Windows portable 要改用其 python_embeded。RealRebelAI 這個節點快照本身沒有 requirements.txt,但程式會呼叫 Diffusers、Transformers、Accelerate、Safetensors、Hugging Face Hub,並依賴 City96 的 ComfyUI-GGUF。重啟 ComfyUI 後先看啟動 log,任何 import failed都先停下處理,不要靠反覆升降整個環境套件來碰運氣。
只下載 Turbo 的三個必要大檔
社群 Turbo 模型庫快照 abfa94e中,INT8 transformer、Q4_K_M 文字編碼器與 VAE 合計約 15.9 GB。這仍是檔案量而非 VRAM。先下載到暫存資料夾,再分別放進 models/diffusion_models、models/text_encoders、models/vae:
hf download realrebelai/LLaDa-Image-Turbo_ComfyUI \
LLaDA-Image-Turbo-INT8.safetensors \
LLaDA-Image-Turbo-text_encoder-Q4_K_M.gguf \
LLaDa_VAE.safetensors \
--revision abfa94e506b4901198e8cda42aa6370165cfebea \
--local-dir ./llada-turbo-files
注意首日整合已有檔名漂移:GitHub README/範例 workflow 仍寫過含 transformer或 -v3的名稱,但上述 Hugging Face 快照實際檔案沒有那兩段。匯入 workflow 後若 loader 變紅,請在下拉選單重新指定剛下載的三個實際檔名,而不是把檔案硬改成不存在的舊名稱。

- 新增 LLaDA Image Loader,選 INT8 transformer、Q4_K_M text encoder、VAE;先用預設
bfloat16、sequential_cpu_offload與 VAE tilingOn。 - 生圖接 LLaDA Image Text to Image,Turbo 設
steps=4、guidance_scale=1.0、seed=42、1024×1024,再接 Save Image。 - 改圖則接 Load Image → LLaDA Image Edit,寬高維持 32 的倍數;不要尋找傳統 denoise-strength 滑桿。
- 完成後接 LLaDA Image Unload。若 OOM,先保留錯誤紀錄,再比較 sequential offload、較小尺寸與 VAE tiling,而不是同時改五個設定。
節點在載入時還會從官方 Turbo 模型庫抓 scheduler、tokenizer、QueryFormer、text projection 與 SigVQ 等輔助元件;目前程式沒有把這次 snapshot_download固定到特定 revision,所以它的版本固定程度仍比前面的官方釘選命令弱。這正是先隔離、保留 log 與記錄 commit 的理由。
Base 50-step vs Turbo 4-step:用固定 seed 做盲測
2026 年 9 月 3 日版官方論文中的作者評測提供方向,但不是你硬體上的保證。其 Qwen-Image-Bench 使用 1,000 個分層 prompt,Base 的英文/中文 overall 為 53.53/53.38,Turbo 為 50.98/50.27;GEdit-Bench 的 606 個案例、11 類任務中,Base 英文/中文 overall 為 7.336/7.294,Turbo 為 7.024/6.898。這些是作者報告數字,表內不同模型有不同版本或取值來源,不適合拿來宣稱全面領先。

自己的 A/B 每題至少跑同一組 prompt、輸入圖、尺寸與 seed;Base 保留 50/5.0,Turbo 保留 4/1.0,因為那是各自的推薦設定。輸出隨機改名為 A、B,再請不知道模型版本的人按 0–2 分評四項:
- 指令遵循:該改的元素是否真的改到。
- 非目標保留:背景、姿勢、物件數量是否被意外重畫。
- 身份/主體一致性:人物或產品的識別特徵是否保留。
- 文字與細節:拼字、手指、邊界、重複物件是否出錯。
論文另一個誠實訊號是 GenEval 的 counting 子項:Base 為 0.53、Turbo 為 0.42。若你的工作經常要求精確物件數量,就把「兩隻杯子、三顆蘋果」納入固定題;不要只測最容易成功的單一主體美圖。想把這套評分做得更穩,可以延伸閱讀 AI 評測怎麼設計。
五個最常踩的坑
1. 把模型庫 GB 當成最低 VRAM
解法是分開記錄。下載量寫 GB,執行時才記峰值 GPU memory、系統 RAM、offload 與解析度。兩者不在同一欄,就不會把指定官方文件未列出的數字寫成顯存門檻。
2. Base 與 Turbo 混用 steps/CFG
解法是把模型與參數綁成 preset。Base=50 / 5.0,Turbo=4 / 1.0。先照官方推薦建立基線,再一次只改一個變數。
3. 改圖尺寸不是 32 的倍數
解法是先規格化輸入。把寬高調成 768、1024、1280 等 32 的倍數,並在縮放前決定要裁切、補邊還是拉伸,避免把前處理失真誤判成模型問題。
4. 把社群節點寫成官方 ComfyUI 支援
解法是保留來源邊界。官方 Python 用 inclusionAI commit;ComfyUI 用 RealRebelAI commit,兩份 log 分開存。若要比較別的節點式本機流程,可參考 MiniMax H3 ComfyUI 本機教學。
5. 只留成功圖,不留失敗條件
解法是每題保存 manifest。檔名至少帶 model、revision、mode、steps、CFG、seed 與尺寸,旁邊放 prompt 和錯誤 log。日後模型更新,才看得出改善來自權重、參數還是運氣。
最後怎麼選:Turbo、Base,還是先暫緩?
- 選 Turbo:你要快速迭代 prompt、批量挑方向,且 4-step 輸出已通過自己的盲測門檻。
- 選 Base:你願意用 50 steps 換取作者評測中較高的整體生成/改圖分數,並在自己的關鍵題目也確認差異值得等待。
- 選官方 Python:你要最清楚的上游基準、精確 revision 與容易比對的參數。
- 選社群 ComfyUI:你接受早期節點、檔名漂移與版本固定程度較弱的代價,並已在隔離環境通過安全與依賴檢查。
- 先暫緩:你的裝置不是目前官方快速開始所記載的 CUDA 路徑,或關鍵需求是穩定人物身份、精確計數,而固定題仍未達門檻。
如果只做一次,最務實的順序是:Turbo FP8 跑通 → 固定兩個生成題與兩個改圖題 → 加入 Base 對照 → 最後才決定是否搬進 ComfyUI。這樣即使節點隔天更新,你仍有一條官方 Python 基準線,不會把介面問題錯當成模型能力。想繼續練習圖片工作流,可接著看 Prompt as Code 圖片工作流、圖片轉 3D 教學,或到 AlphaLab 課程建立更完整的實作路線。
LLaDA-Image 本機生成 FAQ
1. 新手第一個版本該選 Base 還是 Turbo?
先從 Turbo FP8 跑通流程。它的官方推薦設定是 4 steps、CFG 1.0,適合縮短環境除錯與 prompt 迭代時間;確認生成與改圖都能完成後,再加入 Base 50 steps、CFG 5.0 做同題對照。
2. LLaDA-Image 至少需要多少 VRAM?
目前不要引用一個沒有官方依據的最低數字。截至 2026 年 9 月 5 日,本文核對的釘選官方 README 與 v1 論文沒有按顯卡型號列最低 VRAM;請在自己的解析度、offload 與精度設定下,用 nvidia-smi記錄峰值。
3. 下載 FP8 就一定不會 OOM 嗎?
不一定。約 27.6 GB 是官方 FP8 模型庫的檔案總量,只能協助估算下載與硬碟空間;執行時還受解析度、中間張量、VAE、文字編碼器、offload、系統 RAM 與軟體版本影響。
4. Base 一定比 Turbo 畫質好嗎?
不能只憑版本名稱保證。作者報告的整體生成與編輯分數由 Base 較高,但你的主體、文字、計數與一致性需求可能不同;保留各自官方推薦參數,再用固定題與盲測門檻決定。
5. 固定同一個 seed,Base 與 Turbo 會生成同一張圖嗎?
不把「同 seed」理解成「同像素輸出」。固定 seed 的用途是少改一個隨機變因;Base 與 Turbo 本來就是不同推理版本,評分時應比較指令遵循、非目標保留、主體一致性與瑕疵,而不是要求兩張圖長得一樣。
6. 文中的 ComfyUI 節點是 inclusionAI 官方版本嗎?
不是;本文使用的是 RealRebelAI 標示為獨立、非上游的社群整合。把官方 Python commit 與社群節點 commit 分開記錄,先在隔離副本檢查程式碼、依賴與啟動 log,再決定是否放進日常 workflow。
7. LLaDA-Image 適合做人物臉部一致性改圖嗎?
先用已授權素材做自己的盲測,別直接承諾身份保真。2026 年 9 月 3 日版官方論文的公開評測表沒有列出直接的 Base/Turbo 人物身份一致性盲測數字;把臉部特徵、髮型、姿勢、服裝與背景分項評分,未達門檻就暫緩採用。
8. Mac 或 AMD 顯卡可以照抄本文命令嗎?
不要直接照抄並期待相同路徑。截至 2026 年 9 月 5 日,本文核對的官方腳本預設 DEVICE=cuda,指定 README 與 v1 論文也沒有提供可由本文驗證的 Apple MPS/AMD 快速流程;這不代表社群移植不存在,但需要另做相容性驗證。
接著閱讀
左右滑動查看更多推薦
