跳到主要內容

LLaDA-Image 開放權重:2–4 步生圖,離完整開放還差什麼?(2026)

最後更新: ·
LLaDA-Image 開放權重但訓練碼尚未公開,搭配論文中的模型發布展示圖

2026 年 9 月 3 日,inclusionAI 的 AGI Research Center 在 arXiv 發布論文〈LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes〉;這次 LLaDA-Image 開放權重釋出,真正值得看的不是又一張排行榜,而是一個更難的問題:一套以影像資料為主、能生成也能編輯的模型,究竟公開到什麼程度,才足以讓外界驗證它的主張?

作者把 6B diffusion transformer(DiT)、凍結的多模態理解骨幹、Base 與 Turbo 權重,以及 Diffusers 推論程式放上網;官方 repository把權重與推論碼發布日記為 9 月 4 日。這使它成為一個可以下載、可以跑、也值得研究的 open-weight 發布;但「可以推論」和「可以重現訓練」仍是兩道不同的門。

LLaDA-Image 論文的 arXiv 摘要頁與提交日期
LLaDA-Image 論文於 2026 年 9 月 3 日提交 arXiv。圖/arXiv

這篇論文真正想證明什麼?

許多文生圖模型依賴海量「圖片+文字描述」配對資料。LLaDA-Image 的反向做法,是先把超過 90% 的生成訓練樣本留給純圖片,再把語意理解交給一個已經做過視覺 chain-of-thought 微調的多模態模型。作者的核心命題是:影像生成先學好視覺分布,語意再由理解骨幹注入,不必讓昂貴的配對 caption 從第一步就主導全部訓練。

這套主張背後是一條很實際的工程路線。論文報告生成訓練累計使用 2.2 億筆 samples,其中 98% 是真實影像;paired SFT 階段的真實影像比例仍高於 70%。這些數字都是團隊自報,資料集與來源 manifest 尚未公開,因此不能把「2.2 億筆 samples」改寫成同樣數量的不重複、可追溯圖片。

“We do not claim that every component is universally optimal”

中文:我們不主張每個元件在所有情境下都是最佳選擇。

LLaDA-Image 論文

模型如何把理解、生成與編輯接起來

LLaDA-Image 多模態理解骨幹、RQA connector、DiT 與編輯參考影像路徑架構圖
文字經凍結的 LLaDA2.0-Mini 與 RQA connector 進入單流 DiT;編輯另加入參考影像路徑。圖/LLaDA-Image 論文作者,依 CC BY-SA 4.0 授權,僅縮放未改作。

流程可以拆成三層。第一層是 LLaDA2.0-Mini 多模態理解骨幹:它先經過約 260 萬條、每條 16,384 tokens 的 packed sequence 做 CoT SFT,接著在影像生成訓練中凍結。第二層是 RQA 與 connector,把文字與理解訊號整理成 DiT 能吸收的條件。第三層才是論文所稱的 6B DiT;6B 是 DiT 的參數量,官方 Hugging Face 頁面則把包含理解元件的完整 checkpoint 標為 7B。

做文字生圖時,DiT 從文字條件生成影像 latent;做指令編輯時,參考圖則同時走 SigLIP-VQ 語意路徑與 VAE latent 路徑。結果是一個 checkpoint 可以處理生成與編輯,不必為兩種工作維護兩套完全獨立的骨幹。這項價值比較像部署簡化與能力整合,並不自動代表每一項編輯能力都超越專用模型。

統一 checkpoint 也不是編輯 SOTA:作者表中的 Base 在 GEdit-Bench 英文/中文 overall 為 7.336/7.294,低於表內最高的 8.172/8.051,差 0.836/0.757;論文並指出英文 perceptual quality 為 7.182,弱於 semantic consistency 的 8.043。

LLaDA-Image 論文展示的人物風格轉換、海報文字替換、風景編輯與線稿上色案例
論文首頁的四組指令編輯案例,屬作者提供的定性輸出,不是盲測結果。圖/LLaDA-Image 論文作者,依 CC BY-SA 4.0 授權,AlphaLab 拼接、縮放改作。

2 到 4 步減少採樣,但論文真正量的是 4 步

Base 版本的建議設定是 50 個採樣步驟;Turbo 透過 TwinFlow 蒸餾,把採樣壓到 2 至 4 步。這是最容易被標題化的亮點,但表格裡完整呈現的 Turbo 評測採用的是 4 步,不能把同一組品質分數直接搬到 2 步。採樣步數較少通常意味著較低推論成本,但論文沒有提供端到端 latency 或 throughput;理解骨幹與解碼開銷也仍存在,因此不能由步數直接推導實際秒數。

減少步數也不是無損交換。作者的 Qwen-Image-Bench 結果顯示,Base 的英文/中文 overall 為 53.53/53.38,4-step Turbo 降到 50.98/50.27;GEdit-Bench overall 也分別由 7.336/7.294 降至 7.024/6.898。不過 DPG-Bench 的 Turbo 反而略高,所以較精確的結論是:蒸餾後的取捨因任務而異,不能只用一個平均分數概括。想理解這種步數換品質的機制,可接著看站內的模型蒸餾完整教學

53.53 與 53.38 是訊號,不是世界冠軍

LLaDA-Image 論文報告的 Qwen-Image-Bench 英文與中文模型分數比較圖
作者報告的 Qwen-Image-Bench 結果;不是 benchmark 維護者對 LLaDA-Image 的獨立榜單。圖/LLaDA-Image 論文作者,依 CC BY-SA 4.0 授權,僅縮放未改作。

Qwen-Image-Bench 有 1,000 組中英文對齊 prompts,從品質、美學、指令對齊、真實世界忠實度與創意生成五個面向評分,再由 Qwen3.6-27B 的 Q-Judger 自底向上彙整。LLaDA-Image 的 53.53/53.38 是 LLaDA-Image 論文作者報告的成績。截至 2026 年 9 月 6 日,Qwen 的原始論文公開資料集都未收錄 LLaDA-Image,也沒有 benchmark 維護者發布的獨立驗證結果。

在作者所列、且排除 prompt enhancement 或 thinking pipeline 的 open-source 比較組裡,Base 英文比 Z-Image Turbo 高 1.87,中文只高 0.67。Q-Judger 在 Qwen 原始 18 模型上的人類排序相關性為中文 ρ=0.92、英文 ρ=0.90;但那組驗證不含 LLaDA-Image,也不能證明 0.67 分的模型間差距具有統計穩定性。LLaDA v1 未報告這項差距的信賴區間、多個生成 seeds、針對 LLaDA 輸出的新人類盲評,或 Qwen-Image-Bench 去污染檢查;而 prompts 與 judge 在 LLaDA 發布前已公開。因此,這是一個值得外部重跑的領先訊號,不是一頂已經鎖死的皇冠。若要建立自己的驗收方式,可先讀AI Evals 的七步框架

閉源組的 GPT Image 2 在同一 benchmark 表中是英文 65.23、中文 64.69,分別高出 11.70 與 11.31。這也說明「open-source 組領先」與「所有模型領先」是兩句完全不同的話。單一 benchmark 仍不能代表每種創作、排字與編輯工作,但至少足以排除「LLaDA 已是整體 SOTA」這個過度延伸。不過,這不是所有模型在同一天、以同一生成設定重跑的控制實驗:LLaDA 論文說 baseline 多採各模型原始回報分數;Qwen 論文也沒有交代 GPT Image 2 的 API snapshot、quality 設定、輸出解析度與生成 seed。因此 11.70/11.31 只代表表中 benchmark 分數差,不能直接延伸成品質、成本或端到端速度的受控比較。

LLaDA-Image 開放權重:2.2 億筆樣本的「開放配方」有多開?

LLaDA-Image 作者估算的 SFT 加權人物、自然、設計與合成影像資料分布
這是作者估算的 SFT 加權資料組成,不是全部 2.2 億筆訓練樣本的原始分布。圖/LLaDA-Image 論文作者,依 CC BY-SA 4.0 授權,僅縮放未改作。

這次 LLaDA-Image 開放權重有三個扎實成果:Base、Turbo 與兩個 FP8 checkpoint 都能直接下載;官方 GitHub 有 Diffusers 推論 pipeline;論文附上資料篩選門檻、訓練階段、batch size、learning rate、Muon optimizer 與 TwinFlow 蒸餾描述。它遠比只丟一個 API 或一張模型卡透明。

但截至 2026 年 9 月 6 日查閱的 官方 GitHub 固定版本,Open-source Plan 仍寫著:

“Training code (coming soon)”

中文:訓練程式碼(即將推出)。

LLaDA-Image README

這與論文摘要使用現在式、稱已發布 training code 的說法不一致。更根本的缺口則是資料:在本次檢查的官方 GitHub 與 Hugging Face 頁面,未找到可重建 2.2 億筆 corpus 的資料集、來源清單或 provenance manifest。書面 recipe 很詳細,卻還不足以讓第三方從資料到 checkpoint 完整重訓。

授權也要分層看。四個 Hugging Face 模型卡的 metadata 標示 Apache-2.0;GitHub 根目錄則沒有可偵測的 repo-wide LICENSE,只有三個主要 Python 檔案帶 Apache-2.0 header。這不代表程式不可用,而是讀者不應把模型卡上的授權標籤,自動套到 repository 每一個檔案與素材。

我同意什麼,又對什麼保持懷疑

  • 我同意它是有內容的 open-weight 發布。 權重不是預告頁,推論碼不是偽碼,同一 checkpoint 也確實設計了生成與編輯路徑。
  • 我同意 image-only-heavy recipe 值得研究。 它把昂貴 caption 的角色從「所有訓練的入口」改成「後段語意對齊工具」,這是可供下一批模型檢驗的假設。
  • 我不接受把作者報告分數寫成獨立認證。 0.67 分的中文領先尤其需要相同 prompts、明確且固定的各模型生成設定、相同輸出張數與選圖規則、多個 seeds、同一 judge,以及人類盲評。
  • 我也不接受把 detailed recipe 等同完整可重現。 訓練碼與資料 provenance 尚缺,正是「公開權重」和「完整開放訓練」之間的距離。

把這個差距說清楚,不是在否定團隊。發布才兩天,README 也沒有掩飾 training code 尚未完成。更公平的標籤是:一個已可執行、配方相當詳細,但開放訓練鏈尚未補齊的早期發布。 如果你想了解「開放權重」為何不等於所有材料都開放,可延伸讀開放權重政策的兩套安全路線

LLaDA-Image 開放權重後,最值得看的三個驗證

  1. 外部重跑 Base 與 4-step Turbo。 固定 prompts、seed、解析度與 judge,同時加入人類盲評,判斷 0.67 分差距是否穩定。
  2. 訓練碼與資料 manifest 是否補齊。 光有 optimizer 名稱與 batch size,仍看不到資料載入、去重、分散式訓練、checkpoint 恢復與完整 provenance。
  3. 統一模型的部署收益。 在相同顯存、延遲與品質目標下,比較一套生成+編輯 checkpoint,是否真的比兩套專用模型更省維運成本。

想立刻在本機測試,不必從這篇研究評論猜指令;站上已有LLaDA-Image Base、Turbo、FP8 與 ComfyUI 實作教學,可以把輸出與官方案例逐項對照。最有價值的測試不是挑一張最好看的圖,而是保留 prompts、seeds、步數、失敗樣本與硬體紀錄,讓別人能重跑你的結論。

接著閱讀

左右滑動查看更多推薦

如果只做一件事:先下載可用權重,保存一組你自己的固定測試集,再等 training code 上線後重跑。LLaDA-Image 開放權重的真正價值,不在作者給它的形容詞,而在第三方能否一步步把結果重現出來。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。