跳到主要內容

【2026 最新】Kandinsky 6 ComfyUI 教學:選對六代節點,做出五秒有聲短片與驗收紀錄

最後更新: ·
Kandinsky 6 ComfyUI 教學 教學首圖

你找到一支會說話的 AI 短片,照著舊教學安裝節點,卻遇到模型載不進去、影片沒聲音,或放大後人物變形。這篇 Kandinsky 6 ComfyUI 教學先幫你認清六代模型、官方套件與工作流,再帶你設定一個五秒聲畫鏡頭,逐項檢查輸出。

這篇寫給第一次接觸節點式影片生成的讀者。你可以把 ComfyUI 當成把工作卡片用線接起來的製作桌:每張卡只做一件事。以下依 2026 年 10 月 7 日取得的官方文件與模板整理操作;成功標準是留下有聲 MP4、工作流 JSON、實際提示詞與驗收紀錄。

想先理解模型原理與作者評測,可讀 Kandinsky 6 開源影音模型分析。這裡專心處理從選對節點到保存短片的製作流程。

先說結論:Kandinsky 6 ComfyUI 教學先走官方模板

可交付短片=正確模型與節點+完整聲畫接線+可回查設定+逐段驗收。 這四件事像攝影棚的器材、錄音線、場記板與看片會;缺了任何一項,漂亮預覽都還不是完整作品。

  • 先辨認六代:生成套件叫 kandinsky6,超解析套件叫 kandinsky6-sr,發行者是 kandinskylab。
  • 先照官方 Pro Distill 模板:它和 Lite Distill 的可用路徑不同;不要把模型家族名稱當成節點相容清單。
  • 先驗原片:把畫面、聲音與同步分開檢查;確認可用後,再做超解析,並重新驗收放大版本。

① 選對六代模型:Lite、Pro 與 Distill 是兩個維度

為什麼搜尋結果都叫 Kandinsky,設定卻對不上?先看世代,再看大小,最後看訓練版本。 六代官方模型卡列出 Lite 與 Pro 家族,另有蒸餾版與預訓練版。蒸餾可想成讓模型學會較短的解題路線;它不是把 Pro 改名成 Lite,也不代表參數一定變少。

Kandinsky 6 ComfyUI 教學:Lite、Pro、蒸餾版與官方模板的路徑區別
模型卡描述模型家族,ComfyUI 原始碼決定節點能載入哪些 checkpoint;兩份清單要一起核對。

目前官方 ComfyUI 說明與兩個範例都以 Pro Distill起步。更關鍵的是,這次核對的 loader 原始碼對蒸餾 Lite checkpoint 明確拋出不支援錯誤。因此即使你能在 Hugging Face 下載 Lite Distill,也不要直接把它換進這個模板;要選另一條官方模型卡記載的執行路徑,或等節點發布明確相容版本。

本文的製作路線是 Pro Distill 官方模板,先學完整接線。若你的資源不適合這條路,可先到 官方示範 Space查看是否可用,再決定要不要準備自己的 NVIDIA 環境。示範頁能否排到運算與你自己的模型配置是不同問題。

辨識舊教學也要看頁面標題。截至本次查核,官方 Video 網頁的主內容仍標示 5.0;六代操作則以六代 repository 與對應模型卡核對。另有容易誤判的地方:六代模板的 DualCLIPLoader 選項仍寫 kandinsky5,這是共享編碼器的設定字串,不能單靠它判斷裝錯世代。請同時核對套件名、Sampler 節點與 transformer 的六代路徑。

② 安裝六代節點:先驗來源,再下載模型

點到一個舊連結就遇到 404,該從哪裡重來?從官方 Registry 身分重新核對。 打開 Kandinsky 6 Registry 頁,確認套件 kandinsky6、發行者 kandinskylab,以及 Repository 按鈕指向六代專案;SR 則另外核對 kandinsky6-sr。

Kandinsky 6 ComfyUI 官方 Registry 套件名、發行者及 repository 入口
Step 2.1 — 這是 Comfy Registry 實際頁面:核對 Kandinsky 6、@kandinskylab 與 View Repository,再進入自己的 Manager 安裝。圖/Comfy Registry,2026-10-07 頁面截圖。

在 ComfyUI Manager 的 custom-node 清單搜尋並安裝這兩個套件,然後重新啟動。若已經有 comfy-cli 與 Manager,可用 comfy --workspace /path/to/ComfyUI node install kandinsky6 kandinsky6-sr;先把 /path/to/ComfyUI 換成自己的工作區。這是節點安裝指令,不是模型下載指令。

本次生成 extension 的 套件要求列出 ComfyUI 0.38.0+、Python 3.10+。請在這個工作區確認版本;不要拿 repository 主程式的 Python 環境要求,直接套到 ComfyUI extension。兩條路的安裝與卸載機制不同。

如果 Manager 路徑受阻,官方也提供手動方式:把 repository clone 到 custom_nodes 之外,再把其中 comfyui/ 的內容放進 ComfyUI/custom_nodes/kandinsky6/;SR 放進相應的 kandinsky6-sr/。用 ComfyUI 正在使用的 Python執行 python -m pip install -r ComfyUI/custom_nodes/kandinsky6/requirements.txt,SR 同理,再重啟。用系統另一套 Python 安裝,可能讓你看到「裝好了」卻仍缺依賴。

開啟模板後,按設定筆記裡的 Download models。下載器會處理生成模型、文字編碼器、影音 VAE、vocoder 與 VSR 等所需檔案及 JSON 設定。VAE 是把壓縮的內部表示轉回畫面或聲音的元件,vocoder 則把聲音表示轉成波形;就像剪輯工程除了影像素材,還得有音軌和解碼工具。

下載前先盤點磁碟、系統 RAM 與 GPU 顯存。這次官方下載清單還含提示詞擴寫用的 Qwen3.5-9B,它和生成所需的 Qwen2.5 編碼器是兩個角色。模型本體較小,不等於整條流程只載入一個小檔案。 首輪先保留 weight_dtype=default;量化、注意力加速與卸載設定留到能生成後逐項比較。

③ Kandinsky 6 ComfyUI 教學:把第一個鏡頭接完整

空白畫布要先拖哪張卡?先載入官方 JSON,別從零猜接線。 在 Workflow → Browse Templates → kandinsky6 選 Kandinsky 6.0 Text to Video+Audio;有自己的起始圖片時,再選 Kandinsky 6.0 Image to Video+Audio。你也可以從 官方文字影音工作流 JSON下載模板檔並載入,保留原始版作對照。

先認識四段工作:文字編碼把描述變成模型能讀的條件;Kandinsky 6 Sampler 逐步產生聲畫的內部表示;影片與音訊 VAE 各自解碼;CreateVideo → SaveVideo 把影格和音軌裝進 MP4。擴散模型可以粗略想成反覆修正一份草稿,Sampler 就是安排修正順序與步數的工作卡。

Kandinsky 6 ComfyUI 模板中聲畫解碼、超解析與 MP4 保存接線
這是依官方 JSON 繪製的接線概念圖,不是生成介面截圖。官方模板將 VSR 的畫面、音訊與 frame-rate 一起接入 CreateVideo。

依這次核對的 模板設定,Pro Distill 使用 10 steps、CFG=1、denoise=1,音訊 VAE 的 scaling=0.417。CFG 可想成提示詞牽引力,denoise 在這裡控制生成段的更新程度;第一輪照模板值,先確定能輸出。非蒸餾 Pro 使用另一組步數與音訊 scaling,請把它當另一份配置,不要只換權重檔。

模板起始影格設定為 864×480、121 frames、24 fps,官方稱為五秒片段;不是影片一定精確等於 5.000 秒。你應檢查實際檔案時長,而不是把介面最大可填影格數當成更長片段已被驗證的能力。

先做一個簡單鏡頭:固定相機,一隻手敲一次木桌,聲音是一聲短敲擊,背景安靜。這個案例是供你試跑的提示設計,容易看到和聽到同一個事件。若場景、運鏡、多人台詞和配樂一次全加上去,失敗時很難知道是哪個條件造成。

  • video_caption:A fixed camera shows a hand tapping a wooden table once. One clear tap, then the hand rests. No cuts.
  • audio_caption:A single short wooden knock synchronized with the visible tap. Quiet room ambience. No speech or music.
  • 固定跑次:把 Sampler 的 seed 設為你記錄的整數,將生成後控制改為 fixed,保存工作流;日後改提示詞時另存版本。

模板有 Beautify Prompt:它會把你的描述擴寫,結果顯示在 Preview as Text。第一輪為了對照輸入,可把 enabled=false,直接使用自己的兩段描述;之後再開啟擴寫,保存實際送入編碼器的文字。固定 Sampler seed 卻換了擴寫內容,已經是另一個輸入條件。

想試一句話時,把精確台詞放在 video caption 的 <S>Look there!<E> 中;audio caption 寫聲線與環境音。繁體中文可另開一組,例如 <S>我們出發吧。<E>,逐字聽、看有沒有漏字、錯音或結尾被切掉。這是檢查方法;本次沒有足夠直接證據把繁中發音成功率寫成保證。

如果改用圖片模板,請替換 Load Image 裡的官方範例肖像,使用自己有權使用的圖片;保留模板中的圖片縮放與參考影格移除節點。提示詞描述的是圖片裡接下來的動作,別把一張近景肖像和多人遠景指令硬湊在一起。

④ 保存原片,再單獨驗超解析

模板已經含超解析,為什麼還要留原片?分開保存才能定位問題。 官方兩個模板含 VSR;若想先驗未放大版本,另存工作流副本,把 VAEDecode 的影格、Kandinsky6AudioVAEDecode 的音訊,以及 Empty Latent 的 fps 接到 CreateVideo,再接 SaveVideo。保存前檢查三條輸入,不要只留下圖片線。

接著載入 官方獨立 SR 模板,把這支原片作為輸入。超解析是在原片上增加細節的後段工序,並非重拍;先比較有沒有手指變形、邊緣閃爍與切塊接縫,再決定是否採用。兩份檔案分別命名,例如 tap_base.mp4、tap_sr.mp4。

官方提供 2x、2.25x 與 4x。VSR 選 2.25x 時,latent-upscaler loader 用 2x;選 4x 時兩邊都要選 4x。2.25x 是請求倍率,不是精確交付尺寸。 SR 程式還會做 VAE 尺寸對齊與最終 target_resolution 處理;這次模板預設為 none,保留原始 SR 尺寸。需要 1920×1080 時,按交付規格處理後,讀取最終檔案的寬高;不要用倍率心算代替驗收。

SR extension 說明會把影格往 24 fps 重取樣、最多保留 121 影格,音訊裁切到對應長度。請像官方模板那樣,把 VSR 的 images、frame_rate、audio 三個輸出一起傳下去;混用放大後影格與放大前音訊,是你需要另外排除的同步風險。

若已有 FFmpeg 工具,可用 ffprobe 官方檢查器執行 ffprobe -v error -show_entries stream=codec_type,width,height,sample_rate,duration:format=duration -of json tap_base.mp4,核對是否同時有 video、audio stream、尺寸與時長。五秒是這一代公開 checkpoint 的目標任務,不是將短片串接後人物與聲音自動一致的證據。

⑤ 怎麼驗收:畫面、音訊、同步與資源分開記

你看一眼覺得漂亮,為什麼交片時才發現聲音斷了?用三次播放回答三個問題。 先靜音看動作:敲擊次數、接觸位置和手指是否合理;再只聽聲音:是否只有一聲、是否有破音或尾音消失;最後聲畫一起播放:聲音是否出現在可見接觸附近。失敗時記下時間點和原因,保留完整候選。

  • 影片:檔案能播放、目標事件存在、沒有妨礙交付的破圖或閃爍。
  • 音訊:確實有音軌,台詞完整,聲音事件與要求一致。
  • 同步:逐格或慢速播放,記錄敲擊或嘴型與聲音事件的對應位置;先訂你的容許差距。
  • 超解析:尺寸符合交付要求,接縫與新出現的變形已檢查,音軌仍完整。
  • 資源:記 GPU 型號、VRAM、RAM、軟體版本、下載體積、生成與 SR 各自耗時,以及全部候選數。

若使用 NVIDIA 環境,可在生成時用 nvidia-smi觀察 GPU 記憶體,但要註明你的監測間隔;輪詢看到的最高值可能漏掉瞬間尖峰。也記錄 ComfyUI 日誌與程序 RAM。顯存卸載像把器材搬去隔壁倉庫:GPU 騰出位置,搬運與系統記憶體卻仍有代價。

官方 Performance 表是指定配置、暖機後的非蒸餾測試,排除權重載入和 MP4 編碼;不能照搬成本文 Pro Distill 流程的總等待時間。請把第一次下載、載入、生成、超解析、編碼和人工挑片各自記下。你的製作成本可以用「全部候選的總時間 ÷ 合格鏡頭數」衡量;合格數為零時,先修流程。

最小交付資料夾保留 workflow.json、prompt.txt、base.mp4、sr.mp4 和 acceptance.txt。另外記 checkpoint、extension commit、ComfyUI 版本與 seed。這些讓你能追查同一配置;換硬體或底層運算後,是否逐位元相同仍要另驗。

常見問題:Kandinsky 6 ComfyUI 教學的八個快答

1. 看到 kandinsky5 就代表裝錯嗎?

不一定。六代官方模板的 DualCLIPLoader 仍使用這個編碼器選項。核對整套 extension、Sampler 與六代 transformer 路徑。

2. Lite Distill 能直接換進本文模板嗎?

本次版本不行。核對的六代 loader 明確拒絕蒸餾 Lite;HF 有檔案與 ComfyUI 節點能載入是兩個判斷。

3. 10 steps 能套用到所有 Pro 嗎?

不行。這是本文 Pro Distill 配置;非蒸餾版的官方設定不同,音訊 VAE scaling 也要一起核對。

4. MP4 能播放就代表有聲音嗎?

不代表。檢查 audio stream,再實際聽完整片段;有音軌也可能有錯字、靜音或裁切問題。

5. 可以保證繁體中文台詞念對嗎?

本篇不作這項保證。把台詞另設成一個驗收案例,保留原始輸出與逐字紀錄,再決定是否另外配音。

6. 小顯卡一定能跑 Lite 嗎?

不能只看模型大小下結論。還要核對執行路徑、編碼器、RAM、卸載設定與實際錯誤;本文沒有對特定顯存給可跑保證。

7. 2.25x 就是 1920×1080 嗎?

不一定。SR 流程含 VAE 尺寸對齊與最終尺寸選項;先讀實際寬高,再按交付規格調整。

8. 固定 seed 就等於作品能交付嗎?

不等於。它是保存條件的一部分,還要記模型、提示詞、版本與音軌接線,最後看片驗收。

給新手的三個重點

  • 先對身分:六代 repository、套件發行者與模型路徑一起看,別只認一個節點字串。
  • 先做窄鏡頭:固定相機、單一動作、簡短聲音;每次只改一個條件。
  • 先保留原片:工作流、提示詞、全部候選與驗收紀錄一起留,再把超解析作為另一份成品檢查。

接著閱讀

左右滑動查看更多推薦

下一步:先交出一個看得見、聽得見的事件

今天先選「敲一次木桌」,載入官方模板、保存設定,完成一份畫面/音訊/同步紀錄。等這個鏡頭通過,再加一句短台詞和超解析。回到那個公式:正確模型與節點+完整聲畫接線+可回查設定+逐段驗收,才是一支你知道怎麼修改的短片。想安排下一段創作練習,可從 AI 教學文章找相鄰工具,或到 AlphaLab 課程把它接進完整作品。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。已訂閱?管理主題偏好(會寄登入連結到你的信箱)