MiniMax H3 本機教學最容易卡住的,通常不是按下 Queue,而是 Queue 之前的三件事:下載哪幾個檔案、放進哪個資料夾,以及自己的電腦到底撐不撐得住。H3 釋出兩天內,Hacker News 討論累積 326 points、93 comments;隔天就有新手在 Reddit 直接問「究竟要抓哪些檔案」。官方英文文件其實很完整,真正缺的是一份把繁中路徑、硬體現實與錯誤訊息串在一起的操作手冊。
這篇會帶你在 Windows+NVIDIA 顯卡上安裝 ComfyUI、下載官方範本預設權重、完成一支約 5 秒、24fps、32kHz 立體聲的 T2V 影片,再教你何時改用 I2V、首尾幀或 R2V。若你先想理解 H3 的 33B 架構、完整 2K 系統與開放權重邊界,可先看 AlphaLab 的 MiniMax H3 深度解讀。
先記住這個判斷式:本機 H3 影片=正確權重+正確路徑+對得上的工作流+足夠的 GPU/RAM。四項少一項,ComfyUI 的節點圖再漂亮也不會變成影片。
先釐清:本機跑的是 H3-Base,不是完整 2K 系統
MiniMax H3 是開放權重,採自訂 Community License;不能把 Download 按鈕解讀成無地域、用途限制的授權。目前能在 ComfyUI 本機完成的是 H3-Base:官方原生/驗證的 16:9 768p canvas 約 1344×768,影片與聲音一起生成;在 Resolution Selector 輸入更大尺寸,不等於本機跑了完整 2K。MiniMax 官方模型卡列出的 H3-Context-IR 與 H3-Regenerate-2K 仍是託管模組;官方完整 2K 流程會把 API 模組與本機 Base 串起來,並非全離線。
因此,這篇的成功標準很具體:在本機輸出一個有畫面、有立體聲、時間同步的 MP4。不要第一輪就追 2K、15 秒、多人對白或一堆參考影片。先讓最小閉環成功,再逐次增加解析度與控制條件,做法和 LLM 推論引擎的量化與 offloading 相同:先建立可重跑的基準,才知道哪個改動真的有效。
你的電腦能跑嗎?12/16/24GB 沒有一條固定分界
截至 2026-08-05,ComfyUI 官方文件與 MiniMax 模型卡未列 12/16/24GB 統一效能矩陣,也未列正式的最低 RAM/NVMe 表。Comfy 專案負責人曾公開測試 RTX 3060 12GB+32GB RAM+NVMe,在 864×480、5 秒、20 steps 下少於 9 分鐘;launch post則概括稱可在「像 RTX 3060」的 GPU 上運行。這仍不是跨硬體的受控矩陣,不能推成每張 3060 都有同樣時間。下面三例的目的只是校正量級,不是 GPU 排行榜。

給新手的實務起跑線是:12GB VRAM 先跑 0.2MP、5 秒;32GB RAM 已有成功案例,64GB 只是多留系統餘裕。Dynamic VRAM 的權重快取採 file-backed mapping;RAM 受壓時,作業系統可回收映射並從模型檔重讀,不等於把模型權重推入 swap。背景程式與非權重中間資料仍會造成記憶體壓力;快速 NVMe 在磁碟重讀成為瓶頸時可能減少等待,但不是官方最低規格或速度保證。磁碟請為 T2V/I2V 預留至少 80GB;若還要保留 R2V 權重,預留 100GB 比較實際。
步驟一:安裝或更新 ComfyUI 0.30.0 以上
MiniMax H3 原生節點從 ComfyUI 0.30.0 才加入。2026-08-05 的最新標籤是 0.30.2;安裝後先確認版本,不要用「介面打得開」推定 H3 節點已存在。以下流程實作範圍是 Windows+NVIDIA;AMD 請依官方安裝頁選對 GPU 版本,本文的 NVIDIA 社群時間不能套用。
最省事:Windows Desktop
- 從 ComfyUI Windows Desktop 官方頁下載安裝程式,依安裝管理器選擇 NVIDIA。
- 安裝位置選 SSD,避免路徑太深或包含特殊字元。
- 新版 Desktop 到 Desktop Settings → Updates;Legacy Desktop 依官方更新頁使用 Menu → Help → Check for Updates。確認核心版本至少 0.30.0。
- 到 Help → Open folder → Open models folder 記住真正的模型目錄。不要把 40GB 權重塞進應用程式的
resource/ComfyUI。
想要路徑完全可控:Windows Portable
- 從 ComfyUI 官方 Releases下載 NVIDIA Portable,解壓到例如
D:\AI\ComfyUI_windows_portable。 - 要留在 stable,先執行
update\update_comfyui_stable.bat,再執行run_nvidia_gpu.bat。不帶stable的update_comfyui.bat會更新到 development/nightly。 - 瀏覽器開啟
http://127.0.0.1:8188。Portable 的模型根目錄就是ComfyUI_windows_portable\ComfyUI\models。
介面左側點 Templates,選 Video 後搜尋「MiniMax H3」。目前官方頁列出三個範本:T2V、I2V、R2V;「首尾幀」是 I2V 範本裡的進階控制,不是第四個 JSON。

步驟二:下載正確的四個檔案,別把 465GB 全庫抓回來
第一次只跑 T2V、I2V 與首尾幀,請用官方工作流預設的 pruned INT8 ConvRot diffusion+NVFP4 AWQ text encoder。四個檔案合計 42,470,585,471 bytes,也就是 42.47GB(39.55GiB)。R2V 另需同樣大小約 20.97GB 的 ref2va diffusion checkpoint。

Desktop 載入範本後,若 Missing Models 視窗提供 Download,可以讓它自動放置;大檔下載中斷時,手動方法更容易檢查。先安裝 Hugging Face CLI,再從 ComfyUI_windows_portable 的上一層或你自己的 ComfyUI 根目錄執行:
pip install -U huggingface_hub
hf download Comfy-Org/MiniMax-H3 ^
diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors ^
text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors ^
vae/minimax_h3_video_vae_fp16.safetensors ^
vae/minimax_h3_audio_vae_fp32.safetensors ^
--revision 0bd506d2e895983a9663037febda27aa3948cf48 ^
--local-dir ComfyUI/models
上面是 Windows CMD 的續行符號 ^。若你在 PowerShell,最省事是把 hf download 到 --local-dir 寫成同一行。完成後,資料夾應長這樣:
ComfyUI/models/
├─ diffusion_models/
│ └─ minimax_h3_fl2va_pruned_int8_convrot.safetensors
├─ text_encoders/
│ └─ qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
└─ vae/
├─ minimax_h3_video_vae_fp16.safetensors
└─ minimax_h3_audio_vae_fp32.safetensors
要用 R2V,再把 minimax_h3_ref2va_pruned_int8_convrot.safetensors 放進 diffusion_models/。檔案放好後按鍵盤 R 重新整理節點選單;仍找不到就重啟 ComfyUI。
下載完整性怎麼檢查?
瀏覽器顯示「下載完成」不代表 20GB 檔案真的完整。PowerShell 可執行 Get-FileHash 檔名 -Algorithm SHA256;macOS 用 shasum -a 256 檔名。以下 SHA-256 對應 2026-08-05 查核的 Comfy-Org revision 0bd506d2e895983a9663037febda27aa3948cf48:
FL2VA e889202c41dafb67b10d67b97f0d8541508036a6090af23425a5c2615d03c47a
Ref2VA 9255f52b6677845ad238f20dfaafa94727053694127ab7f255c048f0f9365779
Text 35a88d51044231fe332301d7a62aa81e3f2cba62febeb446e2c1e3e0ef76f2c6
Video 7c1f131492e7eddacaac9069a61b81bdd39de5cc96561e677c5eab1cdce5e522
Audio 8e505d95dd1561d47abd43d4238fd40d9bb1ae9e147ed0a4cba778d76ae4db48
步驟三:T2V、I2V、首尾幀、R2V 該選哪一條?

- T2V:只有文字,適合找氣氛、鏡頭與聲音方向;它沒有圖片或參考素材作為條件。若人物、產品或構圖穩定性重要,可改用 I2V、首尾幀或 R2V 增加約束。
- I2V:已有一張人物、產品或場景圖,想鎖住第一眼構圖。若你在製作數字人口播,可搭配 MiniMax+HeyGen 數字人流程理解首幀與聲音素材如何分工。
- 首尾幀:同一個 I2V 範本同時接 first/last image,控制開始與落點。兩張圖的人物比例、鏡位或背景差太大,過程仍可能變形。
- R2V:用圖片、影片、音訊去參考人物、風格、動作、鏡運或聲線。檔案數上限為 9 張圖、3 支影片、3 段音訊,全部合計最多 12 個;每支參考影片與每段音訊需為 2~15 秒,同類型素材總長各不超過 15 秒。音訊不能單獨當唯一參考,必須搭配圖片或影片。
R2V prompt 內的 <Picture 1>、<Video 1>、<Audio 1> 要和節點順序一致。第一次只放一張圖,確認流程能跑,再加第二種素材;一次塞滿 12 個參考,只會讓你無法判斷是哪個條件造成衝突。
步驟四:跑出第一支 5 秒有聲影片
- 在 Template Library 開啟 MiniMax H3 Text to Video。
- 確認四個模型下拉選單都指向前述 FL2VA、NVFP4、video VAE、audio VAE。
- Resolution 選 16:9、0.2MP(608×352);Duration 輸入 5 秒;其餘 sampler、steps 與 attention 先保持官方範本。
- 把範例 prompt 全部換掉,並打開 subgraph 確認沒有殘留官方 vaporwave prompt;硬幣與水果是早期案例的輸出物,不是官方示例文字。
- 按 Queue。第一次冷載入會比第二次慢;完成檔預設在
ComfyUI/output/video/。
第一支影片請刻意簡單:一個人、一個主要動作、一種鏡運,再把聲音分成環境、對白與音樂。可直接用這段做基準:
寫實電影感,雨後傍晚的台北巷口咖啡攤。
一位穿深藍圍裙的女咖啡師站在木桌後,把熱水緩慢倒進手沖壺。
鏡頭從半身中景平順地向前推近;桌上只有一個白色馬克杯,
人物、杯子與攤位的位置全程不變。
她自然地用繁體中文說:「今天第一杯,慢慢來。」
聲音:近處細雨打在遮雨棚、熱水注入的聲音、遠處一聲腳踏車鈴;
極輕的爵士低音,不蓋過對白。不要字幕、文字、Logo 或浮水印。
這段 prompt 沒有要求四次剪接、三個角色或複雜追逐,方便你先驗收「人物有沒有穩、杯子會不會多出來、中文對白是否可懂、聲音有沒有被音樂蓋住」。H3 的長度會向上對齊 17k+5 幀格,所以輸入 5 秒會成為 124 frames,約 5.17 秒;這是正常行為。
從 0.2MP 放大到 768p:一次只改一個變數
第一輪成功後,固定 prompt 與 seed,依序測 0.2MP(608×352)→ 0.4MP(864×480)→ 0.98MP(1344×768)。每一階都記錄總時間、最高 VRAM、最高 RAM、是否發生磁碟大量讀寫、人物與音訊是否通過。不要同時改解析度、秒數、steps、Sage 與量化,否則結果無法比較。
H3 生成端維持 24fps。官方目前三個範例檔都是 MP4/H.264、24fps、AAC 32kHz stereo;若交付平台需要 30fps 或慢動作,請在後製時同步處理影像與音訊,不要只把 ComfyUI 的 frame math 改成 16fps。要進一步剪接、插幀或處理字幕,可參考 AI 影片剪輯工具比較。
常見錯誤排除:依症狀處理,不要一次塞十個啟動參數
1. Missing Models/下拉選單找不到檔案
先比對完整檔名與三個資料夾;Windows 很容易把檔案存成 .safetensors.crdownload 或多一層 MiniMax-H3-main。按 R、重啟,仍失敗就用 SHA-256 檢查。檔案大小接近不代表 hash 正確。
2. CUDA out of memory/整台電腦像當機
- 關掉遊戲、瀏覽器 WebGPU、llama.cpp 與其他占用 GPU 的程式。
- 確認不是抓到 BF16 或 27GB 的 INT8 text encoder;回到官方範本預設的 pruned INT8+NVFP4 組合。
- 回到 0.2MP、5 秒;R2V 只留一張參考圖。
- 保留 Dynamic VRAM 預設。
--cache-none、--fast-disk或--disable-pinned-memory都是針對特定症狀的進階選項,不是萬用配方。
只有當日誌精確出現 HostBuffer.read_file_slice failed,而且小模型也同樣失敗時,才參考 #15255:該 ComfyUI 0.30.1 單一回報用 --disable-dynamic-vram 暫時繞過。這是未結案、非 H3 專屬的例外;先更新並重測,不要把關閉 Dynamic VRAM 當成低 VRAM 常規設定。
截至 2026-08-05,低 VRAM 的 H3 VAE device-mismatch 修正已合併至 master,但尚未出現在 0.30.2 標籤。若錯誤明確指向 register token/device mismatch,優先等下一個包含 PR #15268 的 stable;熟悉 nightly 回退方式的人才提早更新,不要照留言手改核心程式。
3. 影片有 5 秒,聲音只有 3 秒
檢查 subgraph 內的幀數公式仍以 24 計算,並確認 CreateVideo 的 frame rate 是 24;SaveVideo 只負責封裝與 codec。把公式單獨改成 16fps 後,已有一筆未結案的 issue 回報約 5 秒畫面只配 3 秒音訊。若播放器仍異常,先用另一個播放器或 ffprobe 確認 video 24fps、audio 32kHz stereo,再判斷是生成、mux 還是播放端。
4. 畫面一直冒出彩色硬幣、漂浮水果或不相干物件
先進入 subgraph 檢查真正送進模型的 prompt。有一個早期「固定出現漂浮物」回報,回報者表示 subgraph 內殘留官方 vaporwave 範例,清除後問題消失。若 prompt 已乾淨,再縮短鏡頭、固定人物服裝/顏色/物件數量,或從 T2V 改成 I2V/首尾幀。
5. 要不要換 FP8、BF16、GGUF 或 Sage Attention?
第一次成功前都不要換。pruned INT8 diffusion 與 NVFP4 encoder 是官方 Comfy 範本所列、本文驗證的預設路線;pruned FP8 diffusion 其實還小約 12MB。只是截至 2026-08-05,MiniMax 模型卡與 ComfyUI H3 教學未提供 INT8/FP8 的 H3 A/B,不能由檔名斷言速度或畫質排序。官方教學只列 safetensors;GGUF 需第三方量化與 custom node,本文未驗證,不列入第一輪。Sage 的 wheel 必須和 Python、PyTorch、CUDA 對上;先用標準 attention 建立相同 seed 的基準,再逐 workflow 比較。截至同日,#15263 有一筆 v0.30.1 的全域 --use-sage-attention 產生純雜訊回報;先避開全域 flag,若要測試,使用官方文件的 workflow-level Patch Sage Attention KJ 做同 seed A/B。單一回報不代表所有環境必現,也不能把官方「約加速」當成固定倍數。
授權怎麼看?開放權重不等於全球任意商用
就開放權重的 MiniMax H3 Community License 而言,Applicable Territory 排除歐盟、英國、美國與南韓;該授權不允許在排除地區使用、運行、散布或展示 H3 Works/Outputs,需另取得授權。依目前文字,台灣不在排除清單內。MiniMax 的官方 FAQ另稱受控 API 服務全球可用,適用另一套服務條款,不要把 API 與下載權重的地域範圍混在一起。
- 商業規模:產品或服務年營收超過 US$20M,需事先取得 MiniMax 書面授權;低於門檻也仍須遵守其他條款。
- UI 標示:商業產品介面必須醒目顯示「MiniMax H3」。
- 對外發布:公開散布生成內容時,要清楚標示為機器生成。Community License 也不授權在排除地區展示 H3 Outputs;全球可存取的輸出頁面不能只看營運者所在地。
- 提供給第三方使用:要提供 Agreement 副本;上線前用可執行、至少同等保護的條款約束並通知使用者,持續測試安全措施,提供通報管道,調查/移除違規內容並處理重複違規者。
- 散布 H3 Works:需隨附 Agreement、標示修改檔案;非託管式散布還要包含 NOTICE。
- 再訓練:不得用 H3 或其輸出去改善另一個 AI 模型,H3 衍生物除外。
- 輸出權利:MiniMax 不主張輸出所有權,不代表輸出自動通過肖像、商標、著作權或平台規則。
實務決策很簡單:個人測試先核對所在地;要放進產品就把地域、使用者條款、安全措施、通報/移除、營收門檻、UI 標示與 AI disclosure 一起納入上線清單;要再散布權重或衍生物,再加 Agreement/修改聲明/NOTICE。不要只看到 Hugging Face 的 Download 按鈕,就在簡報寫「免費、全球、可任意商用」。
八個新手最常問的問題
1. 12GB VRAM 真的能跑 MiniMax H3 嗎?
已有成功案例,但不保證每台都成功。先用官方範本預設權重、0.2MP、5 秒與標準 attention;RAM、GPU 世代、驅動與背景程式都會影響結果。
2. 32GB RAM 夠不夠?
32GB 有多個成功案例,64GB 較有餘裕。Dynamic VRAM 的權重快取是 file-backed mapping,不會把模型權重直接推入 page file;但瀏覽器、遊戲、本機 LLM 與非權重中間資料仍會吃掉系統記憶體。
3. 為什麼說四種工作流,官方卻只有三個範本?
因為首尾幀是 I2V 範本的可選用法。T2V、I2V、R2V 是三份 JSON;I2V 可只接首幀、只接尾幀,或同時接兩者。
4. R2V 可以只丟一段聲音,讓模型照聲線做影片嗎?
不行。模型卡要求獨立音訊必須和圖片或影片一起使用;而且全部參考檔案合計最多 12 個。
5. 可以在本機直接輸出完整 2K 嗎?
目前不是完整全本機流程。開放權重的 H3-Base 是 768p-class;官方 2K 系統還使用未開放的 Context-IR 與 Regenerate-2K 託管模組。
6. 為什麼輸入 5 秒,輸出是 5.17 秒?
ComfyUI 會把長度向上對齊到 H3 的 17k+5 幀格。5 秒會成為 124 frames;在 24fps 下約 5.17 秒。
7. INT8、FP8、NVFP4 怎麼選?
第一次照官方模板選 pruned INT8 diffusion+NVFP4 encoder。它是本文驗證的預設路線;FP8 雖小約 12MB,截至 2026-08-05 也沒有官方 H3 A/B 足以證明哪一版在每張 GPU 上畫質或速度第一。
8. 生成的影片可以直接商用嗎?
不能用「可以/不可以」一句話回答。先看所在地是否在 Applicable Territory,再依前文完整清單核對 US$20M 門檻、商業 UI 標示、AI disclosure、Agreement 副本、使用者條款、安全措施與通報/移除;若散布 H3 Works,還要處理修改聲明與 NOTICE,並另查素材本身的肖像與權利。
下一步:把一次成功,變成可重跑的影片流程
第一支影片跑出來後,保存四樣東西:workflow JSON、模型 revision/hash、prompt+seed,以及解析度/幀數/耗時/最高 RAM。接著只改一個變數,才能分辨畫質改善來自模型、prompt、解析度還是後製。這套紀錄方式也能接到 Claude Code AI 影片工作室的六階段流程,或用 OpenMontage 把素材整理成可重跑的成片。
你的第一輪驗收不是「像不像官方 demo」,而是「同一份設定能不能再跑一次」。先完成 0.2MP/5 秒/24fps 的有聲閉環,再往 0.4MP、I2V 與首尾幀前進;等你能指出每個檔案、每個節點與每次改動的作用,H3 才真正從一個 42GB 下載任務,變成你的創作工具。想系統化學習 AI 工作流,可接著查看 AlphaLab 的 AI 實戰課程。
