這篇 MiniMax Music 3 本機教學,要帶你在 ComfyUI 做出第一首有主歌、副歌、橋段與器樂段的完整歌曲。重點不只是「把模型跑起來」,而是先分清楚 Lyrics、Section Tags 與 Structured Caption 各自控制什麼,再用固定 seed 比較簡短提示詞與完整描述,最後處理短器樂段、漏唱、曲風偏移、AMD 啟動與 reference audio 等常見問題。
這正是社群現在最想補上的缺口。MiniMax Music 3 開放權重發布後,r/StableDiffusion 發布串在 2026 年 8 月 14 日截稿時已超過 400 票,ComfyUI 官方實作串也超過 140 票;留言反覆追問的不是模型架構,而是工作流在哪裡、多少顯存能跑、器樂段為何提早結束,以及能不能丟自己的歌當參考音訊。票數只是帶時間的需求快照,不是品質評分。

MiniMax Music 3 本機教學先說結論
- 新手最穩的入口:ComfyUI
0.33.1或更新版,不需另裝 custom node;官方範本預設做 60 秒歌曲。 - 下載空間:官方 FP16 DiT 組合約 14.33GB;低顯存 INT8 DiT 組合約 11.92GB。這是檔案大小,不是 VRAM 最低需求。
- 控制心法:歌詞決定唱什麼,段落標籤提示段落與順序,Structured Caption 決定怎麼唱、如何編曲。
- 不要過度承諾:
max_duration是上限,不保證唱滿;BPM、調性、歌詞、配器與段落也不是硬性時間軸。 - reference audio:截至 2026 年 8 月 14 日,官方 ComfyUI workflow 與核心節點沒有音訊輸入插槽;MiniMax 雲端的 cover API/CLI 是另一條產品路徑。
先記住全文最重要的一句:🎵 可控歌曲=Lyrics(唱什麼)+ Section Tags(提示段落怎麼走)+ Structured Caption(怎麼唱、怎麼編)。把它想成拍電影:Lyrics 是台詞,Section Tags 是分場,Structured Caption 則是導演給歌手、樂手與混音師的整體指示;三者都在引導生成,不是硬性時間軸。
MiniMax Music 3 是什麼?它與一般文字生歌有何不同?
MiniMax Music 3 官方模型卡把它定位為可由歌詞與音樂描述生成完整歌曲的開放權重模型,宣稱最長可到約五分鐘。它先用 8B Global LLM 掌握長距離結構,再由 0.6B Local LLM 補足同一時間框內的聲學細節,最後經 Flow Matching 與 Flow-VAE 解碼成音訊。白話說,它不是先做伴奏再硬貼人聲,而是把段落、歌詞、唱腔與配器放進同一個生成問題。
這個設計能處理完整歌曲,卻不等於數位音訊工作站(DAW)的格線。官方明確提醒:tempo、key、instrumentation、lyrics 與 structure 都是生成控制,不是 symbolic constraint。你可以提高某個結果出現的機率,卻不能像在 Ableton Live 裡指定「第 33 小節一定進吉他」。若你剛從影像工作流轉來,可先對照 AlphaLab 的MiniMax H3 ComfyUI 本機教學;兩者都在 ComfyUI 執行,但本篇的成功標準是能匯出一首可從頭聽到尾的歌,而不是一段有聲影片。
MiniMax Music 3 本機硬體需求:先看下載量,再看實用門檻

Comfy-Org 的模型包會從 DiT、text encoder 與 DAV 各選一個檔案。FP16 DiT(4.91GB)+ pruned INT8 text encoder(9.20GB)+ DAV(0.22GB)約 14.33GB;把 DiT 改成 INT8(2.50GB)後約 11.92GB。AlphaLab 的保守建議,是讓磁碟分別至少保留 18GB 與 15GB,替下載暫存、模型索引與更新留空間;這不是官方最低值。也不要把這兩個總和直接寫成 VRAM:執行時還有張量、cache、offload 與音訊長度的成本。
MiniMax 的上游 Diffusers 路徑寫明:未量化 BF16 可在 24GB 以下執行,CPU offload 約用 22GB VRAM,逐層 streaming 可把顯存壓到 8GB,但會更慢。這些數字不是 ComfyUI 的最低保證。ComfyUI 官方範本提供 INT8 DiT 與 tiled_decode 低顯存路徑。因此 24GB 以上可先走 FP16;12~16GB 可嘗試 INT8+tiled,但仍要看系統 RAM、動態 offload 與版本;8GB 使用者若不想研究 Diffusers layer streaming,先用雲端或等待更多 ComfyUI 實測會更省時間。這也是這份 MiniMax Music 3 本機教學刻意不寫「最低 8GB」的原因。
速度也不能只看 GPU 型號。ComfyUI 原生支援 PR的 120 秒 INT8 測試顯示,GPU、作業系統、CUDA Graph 與 CPU 都會大幅改變等待時間,autoregressive 階段也可能受 CPU 限制。這是特定版本與配置的 benchmark,不是購機保證;要估算自己的產能,先固定 workflow 與片長再量 wall time。
開始前:先確認你走的是官方可複製路徑
MiniMax 模型卡的本機參考路徑要求 CUDA,因此本篇可複製的 happy path 是 NVIDIA GPU+CUDA。本文不採用 CPU、Apple Silicon、AMD/ROCm 或 Intel backend 的 Music 3 benchmark 作為新手起點;如果你只是想今天完成第一首歌,先別下載十多 GB 才發現環境不符。尚未安裝 ComfyUI 的讀者,先依官方系統需求與安裝入口完成基本環境。
步驟一:把 ComfyUI 更新到 0.33.1 以上
ComfyUI 0.33.1 已包含 MiniMax Music 3 原生節點,並納入 non-dynamic-VRAM 路徑修正,所以本文直接把 0.33.1+ 當起點。你不需要另裝 custom node,也不應先套用早期社群啟動參數。
- ComfyUI Desktop:開啟
Manage → Update;若 Stable 尚未包含 Music 3 節點,選Latest on GitHub。 - Windows Portable:執行
update/update_comfyui.bat,完成後重啟。 - 手動 Git 安裝:進入 ComfyUI 資料夾,依序執行
git checkout master、git pull、pip install -r requirements.txt,再以python main.py啟動。
若更新後仍找不到模板,先看官方更新指南確認 Desktop/Portable/Manual 的實際版本,而不是先裝來源不明的 custom node。
步驟二:載入官方 workflow 與三個模型檔
在 ComfyUI 進入 Template Library → Audio → MiniMax Music 3。範本會提示下載模型,也可直接核對官方 workflow JSON;若你要手動放檔,路徑如下:
ComfyUI/models/diffusion_models/ minimax_music3_dit_fp16.safetensors 或 minimax_music3_dit_int8_convrot.safetensors ComfyUI/models/text_encoders/ minimax_music3_text_encoder_pruned_int8_convrot.safetensors ComfyUI/models/vae/ minimax_music3_dav.safetensors
官方範本預先填入 max_duration=60、seed 197122968890040、30 steps、CFG 1.7、top_k=50、Euler/simple,並開啟 tiled decode。第一次先只改 Caption、Lyrics 與 duration,其餘範本參數維持預設:先確認模型能載入、60 秒能輸出,再延長歌曲。完成後,到 ComfyUI/output/audio/ 找 audio_minimax_music3_*.mp3。檔名會自動加流水號;v0.33.1 的 ComfyUI DAV 實作把這條路徑設為 44.1kHz stereo,而上游 SGLang 參考 WAV 描述為 32kHz、16-bit stereo。若後製要求固定規格,仍應用 ffprobe 檢查你的實際檔案。
步驟三:用歌詞段落建立真正的歌曲骨架

官方建議使用 [Intro]、[Verse]、[Pre-Chorus]、[Chorus]、[Post-Chorus]、[Bridge]、[Instrumental]、[Solo]、[Outro]。每個 tag 單獨一行;真正要唱的字才放在 tag 下方。以下是一份可直接改寫的原創短版骨架:
[Intro] [Verse] 今晚的風很輕 城市慢慢安靜 我把沒說完的心情 寫進遠方的星星 [Pre-Chorus] 如果明天還有雨 就讓回憶先放晴 [Chorus] 帶我穿過這片夜景 把所有遺憾唱成黎明 就算世界還沒回應 我會記得此刻的聲音 [Instrumental] [Bridge] 我們都曾停在原地 卻也學會再次前進 [Chorus] 帶我穿過這片夜景 把所有遺憾唱成黎明 [Outro]
這個骨架刻意讓一句歌詞維持短而可換氣,也在器樂段保留空白。最佳起點是把主要編曲指令放進 Arrangement,Lyrics 優先保留要唱的文字;需要的表演提示再少量加入、逐次測試。若中文歌詞漏唱,先把長句拆成兩行、減少每段字數,再換 seed。官方 demo展示過華語與粵語歌曲,但目前沒有完整語言支援矩陣,所以「有範例」不能推成每種腔調、咬字都同樣穩定。
步驟四:用 Structured Caption 控制 BPM、調性、唱腔與情緒曲線
Structured Caption 不是把形容詞堆得更長,而是固定用三個區塊回答三組問題:Global Metadata 定義曲風、BPM、調性、情緒與製作輪廓;Vocal Details 定義人聲性別、音色、唱法、和聲與效果;Arrangement 則按段落描述配器如何進場、退場與升級。官方 music-caption-rewriter skill預設輸出 250~450 個英文單字;歌詞仍留在 Lyrics,不要在 caption 重複。
Global Metadata Basic Attributes: Taiwanese indie pop with dream-pop textures, 92 BPM, E minor, 4/4. Nostalgic verses should gradually open into a hopeful chorus. The production feels intimate at first, then wide and cinematic without becoming aggressive. Clean modern mix, warm low mids, controlled transients. Vocal Details Warm alto lead vocal with a close, breathy verse delivery and clearer, stronger projection in the chorus. Natural Mandarin phrasing, restrained vibrato, no spoken-word sections. Soft octave doubles and airy backing vocals enter only in the final chorus. Short plate reverb in verses, wider delay in the bridge and final chorus. Arrangement Intro: filtered electric piano and distant tape texture. Verse: fingerpicked electric guitar, soft kick, rim click, round bass. Pre-Chorus: bass rises, toms and muted strings build gentle tension. Chorus: full drums, open guitars, warm strings and a memorable synth counterline. Instrumental: remove the lead vocal; let guitar and synth trade an eight-bar motif. Bridge: strip back to piano and vocal, then rebuild with cymbal swells. Final Chorus: widest stereo image, added harmonies, stronger drums. Outro: instruments fall away until only electric piano and tape texture remain.
- 把上方英文描述貼到 workflow 的
Caption欄位。 - 把前一節的段落骨架貼到
Lyrics欄位。 - 第一次維持
max_duration=60與官方 seed,其餘範本參數不動。 - 按
Queue Prompt;等待 Save Audio 節點完成,再從output/audio取回 MP3。
這裡的 92 BPM、E minor 與 alto 都是我們主動選定的創作條件,不是模型替你推理出的真相。若你沒有偏好,就別讓任何改寫工具憑空發明精確數值;先用「mid-tempo」「minor-key atmosphere」「warm lower-register vocal」等相對描述,聽過一輪再收斂。
步驟五:固定 seed,比較短 prompt 與完整 caption

這份 MiniMax Music 3 本機教學把「比較 prompt」寫成可重跑流程:複製官方 workflow 成 A、B 兩份。兩邊固定同一個 ComfyUI 版本、模型檔、Lyrics、seed、max_duration、CFG、top_k 與 sampler;A 只寫 A warm Taiwanese indie pop song, nostalgic and hopeful.,B 貼入上方完整 Structured Caption。每次輸出後記錄實際時長、段落順序、主觀 BPM/調性感、配器進出、漏唱/換詞與曲風偏移。
固定 seed 的價值,是減少取樣差異,讓你更容易聽出 Caption 帶來什麼;它不是跨環境的永久指紋。相同模型、工作流、提示、設定、軟體與硬體路徑下較容易重現;換 PyTorch、GPU backend、節點版本後,不應保證 bit-identical。真正的結論也不該是「B 比較好」,而是「B 是否更接近你事先寫下的驗收條件」。
五個常見失敗:先問是哪一層控制出了問題
1. 歌曲只生成 20~30 秒,明明 max_duration 設更長
先接受 max_duration 只是上限。模型可能提早產生結束 token。把測試從 180 秒退回 60 秒,使用完整 Verse/Chorus 歌詞骨架,確認一次能跑完;再逐次增加 30~60 秒。這能找出「流程本身壞掉」與「模型提早收尾」的差別,卻不能保證每次唱滿。
2. 器樂段太短,甚至自己冒出人聲
同時使用 [Instrumental] 與 Arrangement 時間線。在歌詞骨架留下器樂段,在 caption 寫清楚「remove the lead vocal」以及哪兩種樂器交換八小節動機,並替總時長保留空間。不要把重複貼十次 [Instrumental] 當公式;社群有人因此拉長段落,也有人得到 choir,而模型卡已明示段落標籤不是精準小節的 symbolic constraint。
3. 漏唱、換詞或中文咬字模糊
先降低每行資訊密度。讓 tag 獨立一行,把長句切成自然呼吸單位,刪掉 Lyrics 裡的舞台指示,並用 2~4 個 seeds 複跑。這些做法能降低輸入歧義,但官方已明說歌詞不是硬性 constraint;若一句字詞必須法律或商業上完全正確,最後仍要人工驗唱或重錄。
4. 指定老搖滾、金屬或電子子類型,結果仍偏現代流行
把年代拆成可聽見的製作特徵。別只寫「1970s rock」;補上鼓的空間感、吉他放大器質地、編制、和聲密度、立體聲寬度與每段如何變化,再以固定 seed 對照。社群對舊曲風與電子類型的早期評價互相矛盾,所以安全結論是控制可能偏移,不是模型「完全不會」某種曲風。
5. AMD 啟動報錯,或 NVIDIA 出現 CUDA Graph warning
先更新到 0.33.1+,再保存完整錯誤訊息。ComfyUI PR #15588 修正的是 non-dynamic-VRAM 路徑,不代表 AMD 已獲模型專屬保證,也不構成所有人都該加某個啟動參數的理由。模型卡的正式參考路徑仍是 CUDA。另有 RTX 5090 使用者在 issue #15597 回報 allocator warning 後仍完成輸出,但該 issue 尚未結案,不能把所有 warning 都當成無害。
現在該選哪條路?一個簡單決策樹
- 你有 24GB 以上 NVIDIA VRAM:先用官方 FP16 DiT、pruned INT8 text encoder,做 60 秒;若顯存充足可關 tiled decode,比較速度與邊界接縫。
- 你有 12~16GB NVIDIA VRAM:這是可先嘗試的配置,不是最低需求或成功保證。選 INT8 DiT、維持 tiled decode,先做 60 秒;若 OOM,還要檢查系統 RAM、動態 offload、版本與其他佔用,不能只靠 tiled decode 判定一定可行。
- 你只有 8GB VRAM:若目標是今天完成歌曲,先用雲端;若目標是研究本地推論,再走上游 Diffusers layer streaming。不要把「能載入」誤當「適合反覆創作」。
- 你用 AMD、Intel 或 Apple Silicon:ComfyUI 整體可有其他 backend,但 MiniMax 模型卡列出的本機參考路徑為 CUDA;本文不把其他 backend 當成新手可複製起點。若你想理解 Apple Silicon 上「移植成功」與「實用」的差距,可延伸閱讀h3-metal 的本機推論分析。
它做不到什麼?本機、雲端與授權邊界
截至 2026 年 8 月 14 日,官方 ComfyUI 範本的輸入是 caption、lyrics、seed、duration、CFG、top-k 與模型選擇,沒有 reference-audio 插槽;核心 MiniMaxMusic3TextEncode 也沒有音訊輸入。MiniMax 雲端另有 cover API/CLI 路徑,但那不是這個本機 workflow 的隱藏按鈕。若你需要「沿用同一嗓音」「以舊歌改編」或 audio-to-audio,現在不能假設本篇流程已支援。
模型卡另列出幾個明確限制:目前只做 non-streaming generation;tokenized text prompt 最多 5,000 tokens;音訊最多 9,000 acoustic frames;宣稱可做最長約五分鐘完整歌曲,但實際輸出可能更早結束。這也表示一口氣要求五分鐘,不只更慢、更吃資源,還不代表模型會照表唱滿。若你的工作流要把音訊再接到說話、字幕或影片,可參考 AlphaLab 的本機音訊 API 教學與AI 數位人工作流,把生成與後製分成可重跑的階段。
最後,MiniMax Music 3 是依 MiniMax-Music3 Community License 釋出的開放權重,不是簡單的 MIT/Apache 模型。商用介面需醒目顯示 MiniMax-Music3;使用模型之產品/服務與關係企業由該等產品/服務產生的合計年營收超過 2,000 萬美元時,需先取得書面授權;代管生成服務另有安全措施與 AUP 義務。若把生成歌曲公開發布,AUP 也要求清楚且顯著標示內容由 AI 生成;此外仍要處理歌詞、聲音、品牌與第三方智慧財產權。
MiniMax Music 3 本機教學 FAQ
1. MiniMax Music 3 可以完全免費在本機用嗎?
可以下載權重,但不是零成本、無條件。你要負擔硬體、電力與等待時間,商用還要遵守 MiniMax-Music3 Community License。
2. 8GB VRAM 可以直接照官方 ComfyUI workflow 跑嗎?
不建議把它當新手保證。上游 Diffusers 有 8GB layer streaming 說法,但本文引用的官方 ComfyUI 範本未提供對應的 8GB 最低門檻;能載入也可能非常慢。
3. 可以上傳自己的歌曲當 reference audio 嗎?
在目前官方本機 ComfyUI 流程不能直接做。它沒有音訊輸入插槽;雲端 cover API/CLI 是不同產品路徑。
4. 中文歌詞可以唱嗎?
可以測,而且官方 demo 有華語與粵語案例。但沒有完整語言矩陣;用英文 Structured Caption、原語言 Lyrics 與英文 section tags,是目前較清楚的起點。
5. max_duration 設五分鐘,就一定得到五分鐘嗎?
不一定。max_duration 是上限,模型可以提早結束;先從 60 秒驗證,再逐步增加歌曲長度。
6. Structured Caption 能鎖死 BPM 與調性嗎?
不能。它能提供更完整的生成控制,但官方明說 tempo、key 與 instrumentation 不是 symbolic guarantee。
7. 怎麼做比較長的純器樂段?
用 tag 加 Arrangement 雙重引導,但不要期待精準秒數。加入 [Instrumental] 或 [Solo],在 Arrangement 寫清楚移除主唱、樂器與段落演化,並保留足夠總時長。
8. 可以拿生成歌曲商用嗎?
授權可允許商用,但不是自動取得所有素材權利。必須符合介面署名、2,000 萬美元相關年營收門檻、代管服務安全義務;公開發布時還要清楚標示為 AI 生成,並處理歌詞、聲音與第三方 IP。
第一次成功輸出前,只檢查這七件事
- ComfyUI 已是
0.33.1或更新版。 - DiT、text encoder、DAV 放在正確資料夾。
- 第一次用 60 秒與官方 sampler 設定。
- 每個 section tag 都獨立一行。
- Lyrics 只放要唱的文字,不放編曲說明。
- Caption 分成 Global Metadata、Vocal Details、Arrangement。
- 先輸出 A,再固定 seed 只改 Caption 做 B;用驗收條件聽差異。
如果你想把歌曲接進更完整的內容製作,AlphaLab 的OpenMontage 影片工作流可作為下一站;若更關心 MiniMax 模型路線本身,可先讀MiniMax H3 開放權重解析,比較同一品牌在音樂與有聲影片上採用的不同控制面。
接著閱讀
左右滑動查看更多推薦
結語:先完成一首,再追求一次命中
MiniMax Music 3 最值得學的,不是一條神奇 prompt,而是三層控制的分工:Lyrics 管唱什麼,Section Tags 提示段落怎麼走,Structured Caption 管怎麼唱與怎麼編。先用 60 秒、官方 workflow 與清楚的段落骨架完成第一首,再用固定 seed 一次只改一個變因。當你能說清楚這次失敗屬於歌詞、段落、編曲描述、硬體或模型邊界,生成音樂才真正從抽卡變成可迭代的創作流程。





