【2026 最新】MiniMax H3 本機教學:ComfyUI 從下載到第一支有聲影片

最後更新: ·
MiniMax H3 本機教學:使用 ComfyUI 從下載到第一支有聲影片

MiniMax H3 本機教學最容易卡住的,通常不是按下 Queue,而是 Queue 之前的三件事:下載哪幾個檔案、放進哪個資料夾,以及自己的電腦到底撐不撐得住。H3 釋出兩天內,Hacker News 討論累積 326 points、93 comments;隔天就有新手在 Reddit 直接問「究竟要抓哪些檔案」。官方英文文件其實很完整,真正缺的是一份把繁中路徑、硬體現實與錯誤訊息串在一起的操作手冊。

這篇會帶你在 Windows+NVIDIA 顯卡上安裝 ComfyUI、下載官方範本預設權重、完成一支約 5 秒、24fps、32kHz 立體聲的 T2V 影片,再教你何時改用 I2V、首尾幀或 R2V。若你先想理解 H3 的 33B 架構、完整 2K 系統與開放權重邊界,可先看 AlphaLab 的 MiniMax H3 深度解讀

先記住這個判斷式:本機 H3 影片=正確權重+正確路徑+對得上的工作流+足夠的 GPU/RAM。四項少一項,ComfyUI 的節點圖再漂亮也不會變成影片。

先釐清:本機跑的是 H3-Base,不是完整 2K 系統

MiniMax H3 是開放權重,採自訂 Community License;不能把 Download 按鈕解讀成無地域、用途限制的授權。目前能在 ComfyUI 本機完成的是 H3-Base:官方原生/驗證的 16:9 768p canvas 約 1344×768,影片與聲音一起生成;在 Resolution Selector 輸入更大尺寸,不等於本機跑了完整 2K。MiniMax 官方模型卡列出的 H3-Context-IR 與 H3-Regenerate-2K 仍是託管模組;官方完整 2K 流程會把 API 模組與本機 Base 串起來,並非全離線。

因此,這篇的成功標準很具體:在本機輸出一個有畫面、有立體聲、時間同步的 MP4。不要第一輪就追 2K、15 秒、多人對白或一堆參考影片。先讓最小閉環成功,再逐次增加解析度與控制條件,做法和 LLM 推論引擎的量化與 offloading 相同:先建立可重跑的基準,才知道哪個改動真的有效。

你的電腦能跑嗎?12/16/24GB 沒有一條固定分界

截至 2026-08-05,ComfyUI 官方文件與 MiniMax 模型卡未列 12/16/24GB 統一效能矩陣,也未列正式的最低 RAM/NVMe 表。Comfy 專案負責人曾公開測試 RTX 3060 12GB+32GB RAM+NVMe,在 864×480、5 秒、20 steps 下少於 9 分鐘;launch post則概括稱可在「像 RTX 3060」的 GPU 上運行。這仍不是跨硬體的受控矩陣,不能推成每張 3060 都有同樣時間。下面三例的目的只是校正量級,不是 GPU 排行榜。

MiniMax H3 在 12GB、16GB 與 24GB VRAM 的早期社群生成時間個案
三筆設定並不相同:ComfyAnonymous 的 RTX 3060 測試4090 Laptop 個案5090 Laptop 個案;不可跨欄外推。

給新手的實務起跑線是:12GB VRAM 先跑 0.2MP、5 秒;32GB RAM 已有成功案例,64GB 只是多留系統餘裕。Dynamic VRAM 的權重快取採 file-backed mapping;RAM 受壓時,作業系統可回收映射並從模型檔重讀,不等於把模型權重推入 swap。背景程式與非權重中間資料仍會造成記憶體壓力;快速 NVMe 在磁碟重讀成為瓶頸時可能減少等待,但不是官方最低規格或速度保證。磁碟請為 T2V/I2V 預留至少 80GB;若還要保留 R2V 權重,預留 100GB 比較實際。

步驟一:安裝或更新 ComfyUI 0.30.0 以上

MiniMax H3 原生節點從 ComfyUI 0.30.0 才加入。2026-08-05 的最新標籤是 0.30.2;安裝後先確認版本,不要用「介面打得開」推定 H3 節點已存在。以下流程實作範圍是 Windows+NVIDIA;AMD 請依官方安裝頁選對 GPU 版本,本文的 NVIDIA 社群時間不能套用。

最省事:Windows Desktop

  1. ComfyUI Windows Desktop 官方頁下載安裝程式,依安裝管理器選擇 NVIDIA。
  2. 安裝位置選 SSD,避免路徑太深或包含特殊字元。
  3. 新版 Desktop 到 Desktop Settings → Updates;Legacy Desktop 依官方更新頁使用 Menu → Help → Check for Updates。確認核心版本至少 0.30.0。
  4. Help → Open folder → Open models folder 記住真正的模型目錄。不要把 40GB 權重塞進應用程式的 resource/ComfyUI

想要路徑完全可控:Windows Portable

  1. ComfyUI 官方 Releases下載 NVIDIA Portable,解壓到例如 D:\AI\ComfyUI_windows_portable
  2. 要留在 stable,先執行 update\update_comfyui_stable.bat,再執行 run_nvidia_gpu.bat。不帶 stableupdate_comfyui.bat 會更新到 development/nightly。
  3. 瀏覽器開啟 http://127.0.0.1:8188。Portable 的模型根目錄就是 ComfyUI_windows_portable\ComfyUI\models

介面左側點 Templates,選 Video 後搜尋「MiniMax H3」。目前官方頁列出三個範本:T2V、I2V、R2V;「首尾幀」是 I2V 範本裡的進階控制,不是第四個 JSON。

ComfyUI Template Library 範本庫介面
在 Template Library 的 Video 分類搜尋 MiniMax H3;此介面截圖取自 ComfyUI 官方範本文件

步驟二:下載正確的四個檔案,別把 465GB 全庫抓回來

第一次只跑 T2V、I2V 與首尾幀,請用官方工作流預設的 pruned INT8 ConvRot diffusion+NVFP4 AWQ text encoder。四個檔案合計 42,470,585,471 bytes,也就是 42.47GB(39.55GiB)。R2V 另需同樣大小約 20.97GB 的 ref2va diffusion checkpoint。

MiniMax H3 ComfyUI 四個模型檔案名稱、大小與資料夾位置
檔名、byte size 與路徑核對自 Comfy-Org 官方模型庫(2026-08-05)。GB 是十進位下載大小,不是 VRAM 需求。

Desktop 載入範本後,若 Missing Models 視窗提供 Download,可以讓它自動放置;大檔下載中斷時,手動方法更容易檢查。先安裝 Hugging Face CLI,再從 ComfyUI_windows_portable 的上一層或你自己的 ComfyUI 根目錄執行:

pip install -U huggingface_hub

hf download Comfy-Org/MiniMax-H3 ^
  diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors ^
  text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors ^
  vae/minimax_h3_video_vae_fp16.safetensors ^
  vae/minimax_h3_audio_vae_fp32.safetensors ^
  --revision 0bd506d2e895983a9663037febda27aa3948cf48 ^
  --local-dir ComfyUI/models

上面是 Windows CMD 的續行符號 ^。若你在 PowerShell,最省事是把 hf download--local-dir 寫成同一行。完成後,資料夾應長這樣:

ComfyUI/models/
├─ diffusion_models/
│  └─ minimax_h3_fl2va_pruned_int8_convrot.safetensors
├─ text_encoders/
│  └─ qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
└─ vae/
   ├─ minimax_h3_video_vae_fp16.safetensors
   └─ minimax_h3_audio_vae_fp32.safetensors

要用 R2V,再把 minimax_h3_ref2va_pruned_int8_convrot.safetensors 放進 diffusion_models/。檔案放好後按鍵盤 R 重新整理節點選單;仍找不到就重啟 ComfyUI。

下載完整性怎麼檢查?

瀏覽器顯示「下載完成」不代表 20GB 檔案真的完整。PowerShell 可執行 Get-FileHash 檔名 -Algorithm SHA256;macOS 用 shasum -a 256 檔名。以下 SHA-256 對應 2026-08-05 查核的 Comfy-Org revision 0bd506d2e895983a9663037febda27aa3948cf48

FL2VA  e889202c41dafb67b10d67b97f0d8541508036a6090af23425a5c2615d03c47a
Ref2VA 9255f52b6677845ad238f20dfaafa94727053694127ab7f255c048f0f9365779
Text   35a88d51044231fe332301d7a62aa81e3f2cba62febeb446e2c1e3e0ef76f2c6
Video  7c1f131492e7eddacaac9069a61b81bdd39de5cc96561e677c5eab1cdce5e522
Audio  8e505d95dd1561d47abd43d4238fd40d9bb1ae9e147ed0a4cba778d76ae4db48

步驟三:T2V、I2V、首尾幀、R2V 該選哪一條?

MiniMax H3 T2V、I2V、首尾幀與 R2V 工作流選擇圖
先依手上的控制素材選路線;四種用法對應三份官方 ComfyUI 範本
  • T2V:只有文字,適合找氣氛、鏡頭與聲音方向;它沒有圖片或參考素材作為條件。若人物、產品或構圖穩定性重要,可改用 I2V、首尾幀或 R2V 增加約束。
  • I2V:已有一張人物、產品或場景圖,想鎖住第一眼構圖。若你在製作數字人口播,可搭配 MiniMax+HeyGen 數字人流程理解首幀與聲音素材如何分工。
  • 首尾幀:同一個 I2V 範本同時接 first/last image,控制開始與落點。兩張圖的人物比例、鏡位或背景差太大,過程仍可能變形。
  • R2V:用圖片、影片、音訊去參考人物、風格、動作、鏡運或聲線。檔案數上限為 9 張圖、3 支影片、3 段音訊,全部合計最多 12 個;每支參考影片與每段音訊需為 2~15 秒,同類型素材總長各不超過 15 秒。音訊不能單獨當唯一參考,必須搭配圖片或影片。

R2V prompt 內的 <Picture 1><Video 1><Audio 1> 要和節點順序一致。第一次只放一張圖,確認流程能跑,再加第二種素材;一次塞滿 12 個參考,只會讓你無法判斷是哪個條件造成衝突。

步驟四:跑出第一支 5 秒有聲影片

  1. 在 Template Library 開啟 MiniMax H3 Text to Video
  2. 確認四個模型下拉選單都指向前述 FL2VA、NVFP4、video VAE、audio VAE。
  3. Resolution 選 16:9、0.2MP(608×352);Duration 輸入 5 秒;其餘 sampler、steps 與 attention 先保持官方範本。
  4. 把範例 prompt 全部換掉,並打開 subgraph 確認沒有殘留官方 vaporwave prompt;硬幣與水果是早期案例的輸出物,不是官方示例文字。
  5. Queue。第一次冷載入會比第二次慢;完成檔預設在 ComfyUI/output/video/

第一支影片請刻意簡單:一個人、一個主要動作、一種鏡運,再把聲音分成環境、對白與音樂。可直接用這段做基準:

寫實電影感,雨後傍晚的台北巷口咖啡攤。
一位穿深藍圍裙的女咖啡師站在木桌後,把熱水緩慢倒進手沖壺。
鏡頭從半身中景平順地向前推近;桌上只有一個白色馬克杯,
人物、杯子與攤位的位置全程不變。

她自然地用繁體中文說:「今天第一杯,慢慢來。」

聲音:近處細雨打在遮雨棚、熱水注入的聲音、遠處一聲腳踏車鈴;
極輕的爵士低音,不蓋過對白。不要字幕、文字、Logo 或浮水印。

這段 prompt 沒有要求四次剪接、三個角色或複雜追逐,方便你先驗收「人物有沒有穩、杯子會不會多出來、中文對白是否可懂、聲音有沒有被音樂蓋住」。H3 的長度會向上對齊 17k+5 幀格,所以輸入 5 秒會成為 124 frames,約 5.17 秒;這是正常行為。

從 0.2MP 放大到 768p:一次只改一個變數

第一輪成功後,固定 prompt 與 seed,依序測 0.2MP(608×352)→ 0.4MP(864×480)→ 0.98MP(1344×768)。每一階都記錄總時間、最高 VRAM、最高 RAM、是否發生磁碟大量讀寫、人物與音訊是否通過。不要同時改解析度、秒數、steps、Sage 與量化,否則結果無法比較。

H3 生成端維持 24fps。官方目前三個範例檔都是 MP4/H.264、24fps、AAC 32kHz stereo;若交付平台需要 30fps 或慢動作,請在後製時同步處理影像與音訊,不要只把 ComfyUI 的 frame math 改成 16fps。要進一步剪接、插幀或處理字幕,可參考 AI 影片剪輯工具比較

常見錯誤排除:依症狀處理,不要一次塞十個啟動參數

1. Missing Models/下拉選單找不到檔案

先比對完整檔名與三個資料夾;Windows 很容易把檔案存成 .safetensors.crdownload 或多一層 MiniMax-H3-main。按 R、重啟,仍失敗就用 SHA-256 檢查。檔案大小接近不代表 hash 正確。

2. CUDA out of memory/整台電腦像當機

  1. 關掉遊戲、瀏覽器 WebGPU、llama.cpp 與其他占用 GPU 的程式。
  2. 確認不是抓到 BF16 或 27GB 的 INT8 text encoder;回到官方範本預設的 pruned INT8+NVFP4 組合。
  3. 回到 0.2MP、5 秒;R2V 只留一張參考圖。
  4. 保留 Dynamic VRAM 預設。--cache-none--fast-disk--disable-pinned-memory 都是針對特定症狀的進階選項,不是萬用配方。

只有當日誌精確出現 HostBuffer.read_file_slice failed,而且小模型也同樣失敗時,才參考 #15255:該 ComfyUI 0.30.1 單一回報用 --disable-dynamic-vram 暫時繞過。這是未結案、非 H3 專屬的例外;先更新並重測,不要把關閉 Dynamic VRAM 當成低 VRAM 常規設定。

截至 2026-08-05,低 VRAM 的 H3 VAE device-mismatch 修正已合併至 master,但尚未出現在 0.30.2 標籤。若錯誤明確指向 register token/device mismatch,優先等下一個包含 PR #15268 的 stable;熟悉 nightly 回退方式的人才提早更新,不要照留言手改核心程式。

3. 影片有 5 秒,聲音只有 3 秒

檢查 subgraph 內的幀數公式仍以 24 計算,並確認 CreateVideo 的 frame rate 是 24;SaveVideo 只負責封裝與 codec。把公式單獨改成 16fps 後,已有一筆未結案的 issue 回報約 5 秒畫面只配 3 秒音訊。若播放器仍異常,先用另一個播放器或 ffprobe 確認 video 24fps、audio 32kHz stereo,再判斷是生成、mux 還是播放端。

4. 畫面一直冒出彩色硬幣、漂浮水果或不相干物件

先進入 subgraph 檢查真正送進模型的 prompt。有一個早期「固定出現漂浮物」回報,回報者表示 subgraph 內殘留官方 vaporwave 範例,清除後問題消失。若 prompt 已乾淨,再縮短鏡頭、固定人物服裝/顏色/物件數量,或從 T2V 改成 I2V/首尾幀。

5. 要不要換 FP8、BF16、GGUF 或 Sage Attention?

第一次成功前都不要換。pruned INT8 diffusion 與 NVFP4 encoder 是官方 Comfy 範本所列、本文驗證的預設路線;pruned FP8 diffusion 其實還小約 12MB。只是截至 2026-08-05,MiniMax 模型卡與 ComfyUI H3 教學未提供 INT8/FP8 的 H3 A/B,不能由檔名斷言速度或畫質排序。官方教學只列 safetensors;GGUF 需第三方量化與 custom node,本文未驗證,不列入第一輪。Sage 的 wheel 必須和 Python、PyTorch、CUDA 對上;先用標準 attention 建立相同 seed 的基準,再逐 workflow 比較。截至同日,#15263 有一筆 v0.30.1 的全域 --use-sage-attention 產生純雜訊回報;先避開全域 flag,若要測試,使用官方文件的 workflow-level Patch Sage Attention KJ 做同 seed A/B。單一回報不代表所有環境必現,也不能把官方「約加速」當成固定倍數。

授權怎麼看?開放權重不等於全球任意商用

就開放權重的 MiniMax H3 Community License 而言,Applicable Territory 排除歐盟、英國、美國與南韓;該授權不允許在排除地區使用、運行、散布或展示 H3 Works/Outputs,需另取得授權。依目前文字,台灣不在排除清單內。MiniMax 的官方 FAQ另稱受控 API 服務全球可用,適用另一套服務條款,不要把 API 與下載權重的地域範圍混在一起。

  • 商業規模:產品或服務年營收超過 US$20M,需事先取得 MiniMax 書面授權;低於門檻也仍須遵守其他條款。
  • UI 標示:商業產品介面必須醒目顯示「MiniMax H3」。
  • 對外發布:公開散布生成內容時,要清楚標示為機器生成。Community License 也不授權在排除地區展示 H3 Outputs;全球可存取的輸出頁面不能只看營運者所在地。
  • 提供給第三方使用:要提供 Agreement 副本;上線前用可執行、至少同等保護的條款約束並通知使用者,持續測試安全措施,提供通報管道,調查/移除違規內容並處理重複違規者。
  • 散布 H3 Works:需隨附 Agreement、標示修改檔案;非託管式散布還要包含 NOTICE。
  • 再訓練:不得用 H3 或其輸出去改善另一個 AI 模型,H3 衍生物除外。
  • 輸出權利:MiniMax 不主張輸出所有權,不代表輸出自動通過肖像、商標、著作權或平台規則。

實務決策很簡單:個人測試先核對所在地;要放進產品就把地域、使用者條款、安全措施、通報/移除、營收門檻、UI 標示與 AI disclosure 一起納入上線清單;要再散布權重或衍生物,再加 Agreement/修改聲明/NOTICE。不要只看到 Hugging Face 的 Download 按鈕,就在簡報寫「免費、全球、可任意商用」。

八個新手最常問的問題

1. 12GB VRAM 真的能跑 MiniMax H3 嗎?

已有成功案例,但不保證每台都成功。先用官方範本預設權重、0.2MP、5 秒與標準 attention;RAM、GPU 世代、驅動與背景程式都會影響結果。

2. 32GB RAM 夠不夠?

32GB 有多個成功案例,64GB 較有餘裕。Dynamic VRAM 的權重快取是 file-backed mapping,不會把模型權重直接推入 page file;但瀏覽器、遊戲、本機 LLM 與非權重中間資料仍會吃掉系統記憶體。

3. 為什麼說四種工作流,官方卻只有三個範本?

因為首尾幀是 I2V 範本的可選用法。T2V、I2V、R2V 是三份 JSON;I2V 可只接首幀、只接尾幀,或同時接兩者。

4. R2V 可以只丟一段聲音,讓模型照聲線做影片嗎?

不行。模型卡要求獨立音訊必須和圖片或影片一起使用;而且全部參考檔案合計最多 12 個。

5. 可以在本機直接輸出完整 2K 嗎?

目前不是完整全本機流程。開放權重的 H3-Base 是 768p-class;官方 2K 系統還使用未開放的 Context-IR 與 Regenerate-2K 託管模組。

6. 為什麼輸入 5 秒,輸出是 5.17 秒?

ComfyUI 會把長度向上對齊到 H3 的 17k+5 幀格。5 秒會成為 124 frames;在 24fps 下約 5.17 秒。

7. INT8、FP8、NVFP4 怎麼選?

第一次照官方模板選 pruned INT8 diffusion+NVFP4 encoder。它是本文驗證的預設路線;FP8 雖小約 12MB,截至 2026-08-05 也沒有官方 H3 A/B 足以證明哪一版在每張 GPU 上畫質或速度第一。

8. 生成的影片可以直接商用嗎?

不能用「可以/不可以」一句話回答。先看所在地是否在 Applicable Territory,再依前文完整清單核對 US$20M 門檻、商業 UI 標示、AI disclosure、Agreement 副本、使用者條款、安全措施與通報/移除;若散布 H3 Works,還要處理修改聲明與 NOTICE,並另查素材本身的肖像與權利。

下一步:把一次成功,變成可重跑的影片流程

第一支影片跑出來後,保存四樣東西:workflow JSON、模型 revision/hash、prompt+seed,以及解析度/幀數/耗時/最高 RAM。接著只改一個變數,才能分辨畫質改善來自模型、prompt、解析度還是後製。這套紀錄方式也能接到 Claude Code AI 影片工作室的六階段流程,或用 OpenMontage 把素材整理成可重跑的成片。

你的第一輪驗收不是「像不像官方 demo」,而是「同一份設定能不能再跑一次」。先完成 0.2MP/5 秒/24fps 的有聲閉環,再往 0.4MP、I2V 與首尾幀前進;等你能指出每個檔案、每個節點與每次改動的作用,H3 才真正從一個 42GB 下載任務,變成你的創作工具。想系統化學習 AI 工作流,可接著查看 AlphaLab 的 AI 實戰課程

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。