跳到主要內容

MiniMax H3 開放權重:33B Transformer 聲畫同生,但完整系統仍未全開(2026)

最後更新: ·
MiniMax H3 開放權重:33B Transformer 聲畫同生但完整系統仍未全開

2026 年 8 月 3 日,MiniMax H3 開放權重正式登上 Hugging Face:官方在 X 宣布 MiniMax-H3 已公開,同時釋出 H3-Base FL2VA 與 Ref2VA 兩組任務權重。它們可在同一條去噪路徑中生成影片與 32kHz 立體聲,讓原生聲畫模型真正進入可下載、可量化與可改造的階段。

但「單一 33B 模型」只對了一半。官方定義的 33B 是同時預測影音 latent 的 H3-Omni-Transformer;完整 H3-Base 還要加上 Qwen3-VL-32B encoder、Visual VAE 與 Audio VAE,單一任務的 BF16 pipeline 權重總量約 144GB。更準確的說法是:H3 把聲音與畫面放進同一個 33B 生成核心,並沒有把整套系統壓成一份 33B checkpoint。

“H3-Omni-Transformer is a 33B-parameter dense, single-stream Transformer.”

中文:H3-Omni-Transformer 是一個 330 億參數的密集單串流 Transformer。

MiniMax H3 官方模型卡

這也是這次發布最重要的分界:目前能完整在本地驗證的是 768p H3-Base;影響指令編排的 Context-IR、2K 再生成器與稀疏注意力推論實作,截至 2026 年 8 月 5 日都沒有隨權重完整開放。

下文先拆解公開權重的實際範圍,再對照部署與授權條件,最後判斷它距離完整本地影音系統還有多遠。

MiniMax H3 開放權重 Hugging Face 模型頁,顯示 33B 參數、影音生成標籤與 Community License
MiniMax H3 權重頁已列出架構、任務 checkpoints、推理範例與自訂授權。頁面上的點讚數會持續變動;點圖可開啟原始模型頁。圖/MiniMax、Hugging Face

先講結論:33B 生成核心已落地,完整 H3 仍未全開

  • 已可下載:官方 Hugging Face repo提供 FL2VA 與 Ref2VA 兩套 BF16 checkpoints,分別服務文字/首尾幀與多模態 reference 任務。
  • 33B 只是共用生成核心:完整 pipeline 還有 Qwen3-VL-32B encoder 與影音 VAE,不是一份能直接塞進 32GB VRAM 的 33B checkpoint。
  • 本地與雲端仍有落差:截至 2026 年 8 月 5 日,官方可重現的本地核心是 768p H3-Base;Context-IR、Regenerate-2K 與 sparse-attention inference 實作尚未公開。
  • 可下載不等於標準開源:H3 採用自訂 Community License,地域、商用規模、產品標示與輸出用途都有明確限制。
  • 消費級 GPU 能跑,條件不輕:公開的消費級 GPU recipes 通常以量化、CPU offload、較小畫布或多卡換取可行性;官方單張 RTX 5090 示範未披露完整設定,不能概括成固定配方。

社群熱度解釋了為何點燃本地影音圈。截至 2026 年 8 月 5 日下午(UTC+8),Hugging Face 模型頁約有 2,200 個讚;官方轉發的單張 RTX 5090 示範約 14.5 萬次瀏覽、2,100 個讚;LocalLLaMA 討論淨分數約 570,共 119 則留言。這些都是會持續變動的快照,只證明關注度,不是品質、下載量或商用成熟度的 benchmark。

MiniMax H3 開放權重到底包含什麼?

官方模型卡把生成核心定義為 330 億參數的 dense 單串流 Transformer。它把視覺與音訊 latent 包成同一條 sequence,在同一去噪迴圈裡共同預測;前端則使用完整預訓練的 Qwen3-VL-32B,取第 50 層 hidden state 作為條件。輸出不是影片做完後再外接配音,而是從生成階段就共享內容條件與時間軸。

MiniMax H3-Base 官方架構圖,顯示 Qwen3-VL-32B encoder、影音 VAE 與 33B 共享 Transformer
H3-Base 把文字與多模態條件、視覺 latent、音訊 latent 送入同一個 33B Transformer,再分別解碼成影片與 32kHz 立體聲。圖/MiniMax
公開 checkpoint可做的任務主要輸入限制
FL2VA文字生成影音、首幀/尾幀控制生成影音用於 text-to-audio-video 與 first/last-frame-to-audio-video
Ref2VA以圖片、影片、音訊作 reference,再生成影音最多 9 圖、3 段影片、3 段音訊;混合素材合計最多 12 個檔案

音訊 reference 不能單獨使用,必須搭配圖片或影片;影片與音訊各自的總長度上限都是 15 秒。官方模型規格為 4~15 秒、24 fps、預設短邊 768 與 32kHz stereo;目前 Diffusers 配方可用區間為 5~15 秒,顯示 runtime 支援可能晚於模型規格。這裡的「同步」描述聯合生成架構,不等於每次都能完美對嘴、精準對齊音效事件,或保證立體聲空間定位。

硬體門檻也不能只看 33B。從官方檔案大小對帳,單一 FL2VA 或 Ref2VA 的完整 BF16 pipeline 約 144.05GB:Qwen encoder 66.73GB、Omni Transformer 66.28GB、Visual VAE 10.42GB、Audio VAE 0.61GB。官方 SGLang 起始範例用 4 張 GPU;公開的消費級配方多透過量化、CPU/RAM/NVMe offload 重新改寫記憶體算式,速度與品質也要另外實測。

完整 2K H3 仍然是三段式系統

MiniMax H3 官方三段式系統圖,依序為 Context-IR、H3-Base 768p 與 Regenerate-2K
完整 H3 先把多模態指令整理成結構化 context,再由 H3-Base 生成 768p,最後重新生成 2K 版本;截至 2026 年 8 月 5 日,只有中間的 Base 權重公開。圖/MiniMax

H3-Context-IR先把文字、圖片、影片與音訊整理成結構化 context;H3-Base 生成 768p 影音;H3-Regenerate-2K 再根據原始條件與 Base 輸出重建高解析版本。官方把 Context-IR 稱為影響最終輸出品質的關鍵模組,卻只透過 API 提供;模型卡也明確標示最後一個模組未開放。公開 repo 的這兩段範例仍然是呼叫雲端 endpoint 的 shell scripts,不是可在本地重建的原始碼或權重。截至 2026 年 8 月 5 日,該 Hugging Face repo 與模型卡也還沒有附上完整 technical report 或可供外部重現的聲畫同步比較表。

因此,MiniMax H3 開放權重不等於把 7 月 31 日的 API 產品完整複製到本地。截至 2026 年 8 月 5 日,公開 repo 裡的 Context-IR 與 Regenerate-2K shell scripts 仍然呼叫 MiniMax API,沒有附上可下載的對應權重。官方託管系統可選 4~15 秒、最高 2K、24 fps 與 32kHz 立體聲;官方提供的自包含本地驗證流程則以 768p Base 為準。這不代表技術上永遠只能輸出 768p,而是 2K 官方流程在這個時點仍依賴未公開模組。

MiniMax H3 官方 2K 影片示例中的咖啡館人物畫面
官方 2K 示範證明託管系統展示了什麼,不能證明目前公開的 H3-Base 能在本地重現相同流程與成功率。圖/MiniMax

ComfyUI day-zero 支援:能跑,不代表輕

權重一上線,本地社群之所以立刻有反應,是因為工具早已準備好。ComfyUI v0.30.0在 8 月 3 日內建 H3,官方工作流程原生支援 T2V、I2V、R2V,不需要第三方 custom node。Comfy-Org 模型庫也提供 H3 INT8、pruned INT8 與 NVFP4-AWQ Qwen 等量化組合。

這是重要的採用訊號,但要把「能啟動」與「適合日常製作」分開。Diffusers 文件對 24~32GB 顯卡的配方依賴 INT8 與 CPU block streaming;12~16GB 版本還要 offload video VAE、縮小畫布,文件估計 INT8 權重約占 75GB host RAM。SGLang 文件的 2×RTX 5090 案例還需 layerwise CPU offload 與約 384GiB 主機記憶體,生成 5 秒、1344×768、50 steps 約花 560 秒。官方轉發的單張 RTX 5090 影片沒有披露 checkpoint、量化格式、offload、解析度與 steps,因此是可行性示範,不是可重現的效能 benchmark。

對實作者更有用的問題是:固定解析度、幀數與 steps 後,生成一支可交付影片需要多久、多少 RAM 與 NVMe 讀寫、多少重跑,以及量化後品質比 BF16 掉多少。「單卡能跑」只是部署問題的起點。

MiniMax H3 開放權重的授權界線

Hugging Face 頁面把 license 標成 other,實際適用的是 MiniMax H3 Community License Agreement。授權將 Materials 定義為 MiniMax 的專有材料,提供的是附條件權利。Qwen3-VL encoder 自身採 Apache-2.0,也不會讓整套 H3 自動變成 Apache 開源模型。官方 Q&A 說明可申請 formal license,但這是另行授權通道,不是自動獲准。

  • 地域不是只限制商用:授權的 Applicable Territory 排除美國、歐盟、英國與韓國;條文對排除地區的研究、非商用也沒有自動授權。
  • 輸出也被納入:操作性條文連對 Outputs 在排除地區的使用、散布與公開顯示都寫入限制。
  • 大型商用需另談:在適用地域內,若使用 H3 的 commercial products and services 產生超過 US$2,000 萬年度營收,需預先取得 MiniMax 書面授權。
  • 所有商業產品都要標示:產品或服務介面必須顯著顯示「MiniMax H3」,不只限於超過營收門檻的公司。
  • 公開內容要揭露機器生成:Acceptable Use Policy 要求在公開環境顯示生成內容時,清楚且顯著說明是由機器產生。
  • 不能拿去養其他模型:不得用 H3 或其 Outputs 改進 H3/衍生模型以外的其他 AI 模型。

OSI 的 Open Source AI Definition,開源 AI 必須允許任何人為任何目的使用、研究、修改與分享。H3 的地域與用途條件顯然比這更窄,所以最準確的描述是:採專有 Community License 的 open weights,而非 OSI 意義的 open source。這也延續了開放權重模型的產業戰線所揭示的核心問題:下載按鈕不是開放性的全部。

外部證據:託管版偏好測試位於領先群,本地仍要對帳

Artificial Analysis 已把 H3 納入匿名成對偏好測試。截至 2026 年 8 月 5 日查核,H3 在有聲影片編輯榜的 Elo 點估計排第一;有聲文字生影片位於第 1~2 名的統計範圍,有聲圖片生影片則位於第 1~3 名範圍。這比只看官方精選 demo 多一組外部偏好訊號,但它不是本地 H3-Base 與託管版本的等價性測試。

Artificial Analysis 有聲影片編輯榜顯示 MiniMax H3 點估計排名第一
8 月 2 日的同期截圖顯示 H3 在有聲影片編輯榜點估計第一;榜單持續更新,所以表格改列 8 月 5 日查核值。圖/Artificial Analysis
有聲榜單H3 Elo(8/5 快照)樣本數可以支持的結論
文字生影片1,238 ± 96,557rank range 1~2,位於領先群
圖片生影片1,187 ± 105,414rank range 1~3,位於前段
影片編輯1,130 ± 68,240點估計第一,信賴區間仍重疊

這份外部資料顯示 H3 在三種受測任務的偏好分數位於前段,仍無法回答本地量化版的 reference fidelity、聲畫錯位率、失敗重跑率、生成速度與長期穩定性。缺少的 Context-IR 和 Regenerate-2K,恰好又會影響指令整理與最終畫質;因此這些榜單是託管版品質的參考,不是 MiniMax H3 開放權重的重現性證書。

US$0.13/秒有競爭力,但不是全面最低

MiniMax 官方定價列出 H3 2K 每秒 US$0.13、768P 每秒 US$0.08;15 秒 2K 的 US$1.95 只計輸出,不含 Context-IR token 與輸入素材費。Context-IR 另收每百萬 input tokens US$0.90、每百萬 output tokens US$3.60。初次生成的圖片 reference 前 5 張免費,第 6~9 張每張 US$0.04,影片 reference 則按輸入影片長度與輸出解析度收費。從 768P 重新生成 2K 另收每秒 US$0.05,原始 input materials 也會重計:額外圖片每張 US$0.025,輸入影片每秒 US$0.05。

單看每秒輸出牌價,「不到主流模型三分之一」只對部分比較成立。LTX-2.3 Fast 的 2560×1440 公開價格是每秒 US$0.12;Veo 3.1 Preview 的 1080p Lite 是 US$0.08、Fast 是 US$0.12,Standard 為 US$0.40。H3 對昂貴的 Standard 檔確實接近三分之一,對 Lite 或 Fast 檔則沒有;解析度、功能與素材計費也不完全相同。合理的賣點是它以接近低價檔的費率提供 2K 託管輸出與廣泛 reference,不是市場最低價。

AlphaLab 判讀:落地的是可改造底座,不是 API 複製品

值得興奮:承諾已變成可檢查的 artifact

權重檔、config、推理程式與授權文本都已出現,研究者可以檢查架構、做量化、改 sampler,或建立自己的 workflow。截至 2026 年 8 月 5 日,該官方 repo 未提供現成 LoRA 訓練 pipeline;但與只能使用 API 相比,它已多出一條能驗證、量測與改造的路。ComfyUI core 同日接上,也大幅縮短了模型從研究 repo 走向創作者節點圖的距離。

仍要保留懷疑:本地 Base 不等於雲端完整體

最關鍵的 context 整理與 2K regeneration 還留在雲端。若兩者對指令遵循、reference fidelity 與高解析細節的貢獻很大,本地版就可能與 API 榜單存在顯著差距。MiniMax 接下來是否公開這兩段,以及社群能否用替代流程補上,會比「單卡能出片」更能決定 H3 的長期價值。

它很少見,但不是第一個

同步生成影音的 open-weight 模型已有 LTX-2OviMOVANAVA;LTX-2 採 community license,Ovi 與 MOVA 採 Apache-2.0。NAVA 的主模型/程式標示 Apache-2.0,但其必需的 LTX Audio VAE 另受 LTX-2 Community License 約束,不宜把整套可部署套件概括為純 Apache-2.0。H3 比較突出的地方,是把多張圖片、影片、音訊 reference、4~15 秒生成與託管 2K 流程放到同一產品裡。真正稀缺的不是「有一個能下載的影音模型」,而是多種 reference 能否在同一 context 中穩定協作。

真正的邊界是系統開放度

影片模型的能力越依賴前處理、context compiler、專用 attention、再生成與部署 runtime,單一 checkpoint 就越不能代表整個產品。這和開源與封閉 AI 的市場分工一樣:競爭單位正在從「一份權重」變成「權重加上整套可重現系統」。H3 這次向開放前進了一大步,也同時畫出了尚未跨過的界線。

現在怎麼測,才不會只重播官方 demo?

  1. 先選對版本:首尾幀與文字生成用 FL2VA;多模態 reference 用 Ref2VA。不要一次下載兩套,再把儲存空間當成 VRAM 需求。
  2. 固定輸入做 API/本地對照:使用相同素材與 prompt,各跑多次,分別記錄角色一致、動作完成、聲畫同步與可交付比例。
  3. 完整記錄部署成本:除了 VRAM,也記錄 RAM、NVMe 讀寫、量化格式、解析度、幀數、steps、耗時與峰值記憶體。
  4. 商用前逐條讀授權:先確認所在地、營收門檻、介面標示、散布方式與模型改進用途;不要把「Hugging Face 可下載」當成全球無條件商用。

接著閱讀

左右滑動查看更多推薦

接下來判斷 MiniMax H3 開放權重能否從高熱度發布變成影音基礎設施,只看三件事:Context-IR、Regenerate-2K 與 sparse attention 是否真的釋出;量化 H3-Base 在固定測試下能否接近託管版;社群能否在授權限制內建立可維護的工具鏈。三條都成立,H3 才不只是一份重量級權重,而是一個能被持續改造的影音生成底座。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。