跳到主要內容

Kandinsky 6 開源影音模型:同步聲音、五秒片長與品質證據怎麼看?(2026)

最後更新: ·
Kandinsky 6 官方生成作品拼貼與音畫開放、五秒起步標題

2026 年 10 月 4 日,Kandinsky Lab 在 arXiv 提交了技術報告〈Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation〉;官方 repository則記錄了 10 月 6 日的開源發布。Kandinsky 6 把五秒影片與同步聲音放進同一個模型家族:值得關注的,是影音生成多了一條可下載、可檢查的路,而它離穩定交片還有多遠?

Kandinsky 6 技術報告的 arXiv 原始頁面
圖/arXiv、Kandinsky Lab。原始頁面截圖;點圖可閱讀全文。

先看這次公開了哪些東西,再拆開模型機制與作者評測,最後回到一個實際問題:你需要的是可研究的模型,還是能準時交付的鏡頭?兩種需求會給出不同答案。

Kandinsky 6 公開了什麼:模型、聲音與另一道放大工序

依官方發布資料,Lite 為 3B 參數,Pro 為 29B 參數;兩者支援文字或起始圖片引導的影音生成,輸出五秒片段與 44 kHz 聲音,涵蓋語音嘴型同步。這是家族規格,不代表每次生成都能對準嘴型、念對台詞或符合畫面指令。Pro 蒸餾版模型卡另列了自己的取樣設定,不能把它和非蒸餾版混為同一個跑次。

To accelerate open research and deployment in multimedia generation, we release the code, model checkpoints, and diffusers integration under the MIT license.

中文:為促進多媒體生成的開放研究與部署,團隊以 MIT 授權公開程式碼、模型權重及 diffusers 整合。

Kandinsky 6 技術報告摘要

目前能核對的實物包括 repository 的 MIT 授權檔、Hugging Face 上的權重與模型卡,以及 ComfyUI 擴充與超解析度節點說明。授權給研究與整合更大的操作空間;運算資源、安裝維護與素材取得,仍是另外的成本。

「Full HD」也要拆開讀。作者的基礎生成先在 SD 完成,再由獨立超解析度模型處理成 1920×1080 等輸出;模型卡亦把它列為另一條 pipeline。輸出檔案的像素數,與模型原生生成的細節不是同一件事。 對成品而言,放大後的質感可能有價值;對研究比較而言,卻應註明多走了一道工序。

它怎麼讓畫面與聲音互相看見?

報告的核心是雙流 CrossDiT:影片分支沿用 Kandinsky 5.0 的基礎,聲音分支另行訓練,兩邊以雙向交叉注意力交換資訊。可以把它理解成同時排練的演員與音效師:各自保留專長,但每一步都能參考對方,而非先把畫面做完才臨時貼上配樂。

Kandinsky 6 雙流 CrossDiT 架構,影片與音訊以交叉注意力交換資訊
圖/Kandinsky Lab 技術報告,Figure 1(CC BY 4.0)。上方為影片分支,下方為聲音分支;本圖僅縮小,保留原始內容。

團隊先分開訓練,再用配對影音共同訓練,之後接上精選資料微調、強化學習與蒸餾。這條路線的意義,在於把「聲音說了什麼」「畫面發生什麼」「是否同時發生」放進共同優化的流程。架構提供協調機會,可靠性則仍要由輸出驗收。

這個方向已有其他公開系統。Lightricks 的 LTX-2 repository也提供同步影音生成與不同推論路徑。Kandinsky 6 的價值,應放在另一套可檢查的設計與取捨上,而不是靠「影音首次開放」這類口號成立。

Kandinsky 6 作者生成的街頭吉他手連續影格與音訊波形
圖/Kandinsky Lab 技術報告,Figure 26(CC BY 4.0)。這是作者提供的生成範例:吉他手與觀眾影格,下方配有音訊波形;不是實景照片或 AlphaLab 實測。

這張範例能看見作者想展示的方向,卻有一個展示媒介的限制:靜態影格與波形不能讓你聽見音質,也不足以證明每個音都對上動作。 真正驗收要播放原始片段,分別聽、看,再一起檢查。漂亮的單格可作入口,不能取代完整鏡頭。

Kandinsky 6 的品質證據:作者有亮點,也交代了輸的地方

報告用了自動化指標與並排人類評測。VABench 原始研究本身評估文字、影像與聲音之間的對應、音畫同步與嘴型等面向;使用這套尺,不等於由 benchmark 作者替 Kandinsky 做了獨立認證。本文討論的成績,來自 Kandinsky 團隊自己的執行與報告。

作者自評指出 Pro 在部分語音及同步面向有競爭力,但對手與模式一換,領先項目也會換。尤其與 MiniMax H3、Seedance 2.0 比較時,原報告承認視覺項目有差距。「一些指標較好」不能被改寫成「所有任務較好」。

作者的 Kandinsky 6 Pro 與 MiniMax H3 文字影音並排偏好評測
圖/Kandinsky Lab 技術報告,Figure 19 的文字影音比較(CC BY 4.0)。淺綠為 Kandinsky 6 Pro、灰色為平手、深色為 MiniMax H3;屬作者評測,並非獨立排行榜。

圖上每欄衡量不同問題。人類偏好、文字跟隨、音質與同步不能互相代替;灰色平手也不應被算成某一方的勝出。更值得讀的是測試設計:作者匿名並排影片、隨機左右位置,先關聲音評視覺,再開聲音。這有助減少一些干擾,但依舊是特定樣本和流程下的觀察。

另一個易被濃縮的數字是語音字錯率相對下降 47%。作者用 64 個提示詞、每題 3 個 seeds 比較 Pro 強化學習前後,WER 從 0.235 降至 0.124;這不是對商用模型的全面領先幅度。這一組用 Whisper-large-v3 評分,而它也參與訓練獎勵:同一把尺兼任訓練目標與驗收工具,更需要另一把尺交叉檢查。後面的 benchmark 另用 Qwen3-ASR 算 WER,兩組數字不能直接對帳。

截至 2026 年 10 月 7 日,本文查閱的公開證據足以說明作者的設計與自評;本文未取得可獨立確認其整體品質排序的公開重跑結果。對讀者最可靠的做法,是把這些成績當成待驗證的起點。若想了解如何把 demo 改成可驗收案例,可接著讀 AI Evals 入門。

能跑在自己的電腦,與值得跑,是兩道問題

Working time (s) for a 5-second clip on the non-distilled model, after warmup. Weight loading and MP4 encoding are excluded.

中文:以下秒數衡量的是暖機後、非蒸餾模型生成五秒片段的工作時間;不包含權重載入與 MP4 編碼。

Kandinsky repository:Performance

官方時間表列出 RTX 4090 的 Lite SD 為 437 秒、Pro Full HD 為 1,247 秒,換算約 7.3 分鐘與 20.8 分鐘。這些是作者在指定注意力與卸載設定下的數字,不是你今天下載預設蒸餾版就會遇到的等待時間,也不是整段創作從輸入到交付的耗時。

顯存卸載把部分權重搬到 CPU 記憶體,降低 GPU 常駐需求,代價是資料搬運與 RAM 壓力。報告列有 16/24/32 GB 顯卡預設;其中 Pro 的 16 GB 設定,作者量到約 58 GiB 的程序常駐記憶體。這是作者指定配置的量測,不能把「有 16 GB 顯卡」簡化成「整台電腦一定裝得下」。

這次沒有在 AlphaLab 主機下載大型權重或執行生成;本文採來源分析。若你要評估本機配置,可先讀 顯存與卸載的基礎分工:那篇以語言模型為例,概念可幫助理解硬體分工,但它的容量公式與 KV cache 數字不能直接套用影音模型。

我的判讀:開放的是控制權,交付品質要另外算

我同意:把模型交出來,比只公布一張排名更有價值

研究者可以檢查組件、固定權重版本、追查一次生成用了哪些設定。開放權重讓失敗有機會被定位:是聲音分支、提示詞、卸載,還是超解析度?這些問題有可操作的入口,而不只剩「再抽一次」的按鈕。

我存疑:省下 API 帳單,未必省下整體工作

如果你需要十個候選才能挑出一個合格鏡頭,真正成本會包含十次等待、九次篩選與最後的剪輯。可以用「總生成與篩選時間 ÷ 合格鏡頭數」記帳,再加上聲音修正與硬體費用。一次生成便宜,只有在合格率與修改量也能接受時,才會變成製作優勢。

五秒適合驗一個事件,長片則需要更多決定

一個敲擊、一句短台詞或一段樂器動作,足以檢查同步是否值得投入。但連續故事還有跨鏡頭人物、音色、節奏與場景接續的問題;把五秒片段排在一起,不會自動回答它們。這是評估尺的延伸,並非本文聲稱模型已完成或無法完成的功能測試。

下一個證據,應是可重做的合格率

作者把更長片長、更高原生解析度與更多參考條件列為未來方向;目前它們應被讀成研究路線,不能當作已交付功能。若接下來社群公開固定題目、全部 seeds、失敗片段與硬體紀錄,比另一支精選宣傳片更能幫你決定是否採用。

現在可以怎麼試:先定驗收,再開生成

先用 官方 Pro 蒸餾版示範頁或你已有資源的環境觀察一個小任務。示範頁是官方提供的入口,當下是否排得到運算要以實際頁面狀態確認。從虛構角色短句、手敲木板、樂器動作各挑一種,先寫下「怎樣才算通過」。

將畫面、台詞與聲音事件分開驗:先靜音看動作,再閉眼聽台詞,最後一起播放查時間對應。固定同一個 checkpoint、解析度與提示詞,保存多個 seeds 的全部片段、等待時間及需要修正的地方。再用同樣任務比較你現有的方法;如果只展示挑中的最好一段,就很難知道改善來自模型還是篩選。

若工作涉及真人聲音或臉孔,把取得同意和標明合成來源納入素材流程,避免讓生成片段被看成當事人的真實發言。偵測分數也不能代替來源紀錄;相關判讀可接著讀 AI 影片偵測器與誤判。

接著閱讀

左右滑動查看更多推薦

Kandinsky 6 值得關注,因為你能開始檢查與改造這條音畫生成管線。 下一步先留下三個合格鏡頭與它們的全部候選紀錄;看清楚代價後,再決定要把它當研究材料、創作草稿,還是製作流程的一部分。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。已訂閱?管理主題偏好(會寄登入連結到你的信箱)