MiniMax H3 在 2026 年 7 月 31 日正式上線 Hailuo AI 與 MiniMax API。它把文字提示、圖片、影片與音訊 reference 放進同一個請求,最長生成 15 秒、最高 2K。MiniMax 稱聲音由模型共同生成為原生立體聲,公開示例可驗證為 AAC 雙聲道。這不只是「又一個畫質更高的影片模型」;MiniMax 真正想做的,是把角色一致性、動作轉移、運鏡、風格、聲音與生成式編輯,收進同一套 context。
市場確實有反應。截至 8 月 2 日凌晨,官方技術長文在 X 約有 31.3 萬次觀看、2,400 個讚;主發布帖約 43.2 萬次觀看。不過,熱度最高的兩個字——「開放」——也最需要拆開查證:API 已經能用,權重在查核時仍不能下載。

先講結論:H3 的突破與承諾要分開看
- 已確認:公開 API 已上線,輸出為 2K、4~15 秒、24 fps;同一個
content[]可混合文字、圖片、影片與音訊 reference。 - 已有外部支持:Artificial Analysis 的即時盲測榜把 H3 列在有聲影片編輯的點估計榜首;文字生影片則與 Gemini Omni Flash 落在統計並列的領先區。
- 價格有吸引力,但不是全面最低:2K 輸出每秒 US$0.13,15 秒為 US$1.95;影片 reference 另按輸入秒數計價。
- 尚未兌現:截至 2026 年 8 月 2 日凌晨,官方 Hugging Face、GitHub 與 ModelScope 都還沒有可下載的 H3 權重,完整技術報告也未發布。
MiniMax H3 到底把什麼合在一起?
目前 MiniMax 國際 V2 API 的 model 欄位只接受 MiniMax-H3,不同任務也共用 V2 video generation endpoint。開發者不必切換模型或 endpoint,但仍要用 content[].type 與 role 明確編碼生成模式和素材角色,再用文字說明各素材之間的關係。
“Reference and editing relationships expressed through natural language rather than confined to a fixed task set; language … is the bridge to generalization.”
中文:參考與編輯的關係改由自然語言表達,不再被固定任務限制;語言⋯⋯是通往泛化的橋梁。
MiniMax H3 技術長文
翻成白話:模型不再把「參考角色」「模仿運鏡」「沿用聲音」各自當成固定按鈕,而是嘗試讓語言描述素材之間的關係。官方給的例子是:沿用影片 1 的希區考克式運鏡,讓圖片 2 的角色唱歌,再讓歌聲對齊音訊 3。這種設計和我們在 FLUX 3 世界模型分析談到的方向相同:價值不只在單項生成能力,而在不同模態能否共享同一個可操作的上下文。
| API 元素 | 目前公開限制 | 容易忽略的條件 |
|---|---|---|
| 文字 | 每次都必須提供,最多 7,000 字元 | 它負責說明各素材的用途與關係 |
| 圖片 reference | 最多 9 張 | 前 5 張免費,第 6~9 張每張 US$0.04 |
| 影片 reference | 最多 3 段;單段 2~15 秒,合計不超過 15 秒 | 按輸入秒數另計費 |
| 音訊 reference | 最多 3 段;單段 2~15 秒,合計不超過 15 秒 | 不能單獨使用,至少要搭配圖片或影片 |
| 混合素材 | 圖片、影片、音訊合計最多 12 個檔案 | reference 模式不能和首尾幀模式同時使用 |
| 輸出 | 2K、4~15 秒整數、24 fps | 768P 仍是封閉測試,並非一般 API 的公開選項 |
這已經比「一張圖加一句 prompt」更接近生成式剪輯器,但仍不是 Premiere 或 DaVinci Resolve 那種可鎖定時間碼與區域的編輯介面。截至查核時,MiniMax 公開的 H3 V2 API schema 只列 /v2/video_generation,未列獨立 editing endpoint,也未提供 mask、edit strength、source lock 或局部鎖定欄位;所謂影片編輯,目前更準確的說法是透過 reference-to-video 進行再生成。

MiniMax H3 的「原生 2K」與「原生立體聲」要拆開看
先看可驗證的輸出。MiniMax 官網一支橫向示例檔實際是 2560×1440、24 fps、約 15.08 秒,音訊為 AAC 雙聲道;直向示例則是 1440×2560。也就是說,至少這支 16:9 官網樣片的「2K」是 2560×1440,與電影規格 DCI 2K 的 2048×1080 不同;API 文件本身沒有列出所有長寬比的像素矩陣。該示例的左右聲道也不是把同一條單聲道原封不動複製兩次,但這仍不足以證明每個場景都有穩定的空間定位、口型同步與事件同步。
再看生成方式。官方說 H3-VAE 的高壓縮率讓有效序列長度提高 4 倍,並以 H3 base model 對低解析輸出做 in-context regeneration,而不是外接傳統超解析模組。因此「原生 2K」比較接近同一基礎模型自己重建高解析版本,不等於已證明模型從頭到尾只做一次全解析度生成。
官方還表示,分離不同訓練工作負載後,端到端吞吐量提高近 30%。這些架構數字目前都來自發布長文;截至查核時間,官方仍只預告完整技術報告稍後發布,權重與可重現程式也尚未到位,所以它們是合理的工程說明,還不是外部可稽核的結果。
獨立盲測補上了什麼,仍然缺什麼?
這次不能再說品質「完全只有官方 demo」。Artificial Analysis 已把 H3 納入匿名成對比較:評測者不知道模型名稱,只在兩段輸出之間選偏好,再用 Elo 彙整。H3 的初期成績很強。

| 有聲榜單 | H3 名次與 Elo | 樣本數 | 正確解讀 |
|---|---|---|---|
| 文字生影片 | 第 2;1,242 ± 11 | 5,101 | rank range 為 1~2,與 Gemini Omni Flash 統計並列領先 |
| 圖片生影片 | 第 3;1,184 ± 11 | 5,039 | rank range 為 2~3,與前兩名仍在重疊區 |
| 影片編輯 | 第 1;1,130 ± 7 | 5,056 | 點估計榜首,但與第 2 名的信賴區間重疊 |
這份外部證據足以支持「H3 已進入第一梯隊」,卻還不能直接推出 commercial-grade。Artificial Analysis 的有聲與編輯榜目前公開的是 preference Elo,方法頁也明示這些模態不做 latency benchmark;這三張公開榜單沒有分項呈現多次生成成功率、角色漂移、文字與商標正確率、局部保留率、聲畫錯位率、SLA、版權治理或冒用防護。真正的商用成本,是每支可交付成片花多少錢,而不是每次 API 呼叫多少錢。
US$0.13/秒很有競爭力,「不到三分之一」卻不是普遍事實
MiniMax 國際 API 定價很直接:H3 2K 輸出每秒 US$0.13,15 秒是 US$1.95。若再放入 15 秒影片 reference,輸入端也按每秒 US$0.13 收費,合計已是 US$3.90;若用滿 9 張圖片,再加 US$0.16,總額為 US$4.06。音訊 reference 不另收費。
| 模型/檔位 | 公開解析度 | 輸出價格 | 比較重點 |
|---|---|---|---|
| MiniMax H3 | 2K | US$0.13/秒 | 4~15 秒;reference video 另計輸入費 |
| LTX-2.3 Fast | 2560×1440 | US$0.12/秒 | 價格略低,已有可下載權重;在 AA 有聲 T2V 的受測設定(1080p 或各模型最接近值)中明顯落後 H3 |
| Google Veo 3.1 Fast | 1080p | US$0.12/秒 | 解析度不同,不能直接當等價替代 |
| Google Veo 3.1 Standard | 1080p | US$0.40/秒 | H3 對這類昂貴旗艦確實接近三分之一 |
所以 MiniMax 所說的「2K 每秒價格不到主流模型三分之一」,必須知道比較籃子才能成立。和高價標準版模型相比,它很便宜;和 LTX-2.3 Fast 或 Veo 3.1 Fast 相比,就不是三分之一。H3 的合理賣點是以接近低價檔的費率,交出目前第一梯隊的偏好分數與較高解析度,而不是「市場最低價」。
開放權重:整則新聞最重要的一句,還沒成真
MiniMax 把 H3 稱為 open model,發布文則用未來式承諾在數日內開放權重,並附上需符合適用法律與監管的條件。截至 2026 年 8 月 2 日 03:44(台北時間),官方 Hugging Face 的 19 個模型裡沒有 H3,官方 GitHub 也沒有 H3 model repo;ModelScope 預發布頁排定 8 月 3 日 00:00 上線,但當下仍沒有可下載權重。
這也是為什麼不能把合作平台 fal 頁面上的「Open Weights」標籤當成已發布證據:它沒有權重下載連結,而且和 MiniMax 自己的未來式說法衝突。官方開源 CLI 已加入 H3 的 API 呼叫程式碼,但這不等於模型權重、推論 runtime 或訓練程式已開源。
更重要的是,H3 並非第一個同步生成音畫或接受多模態 reference 的模型。Seedance 2.0 早已展示 9 圖、3 影片、3 音訊的統一 reference;LTX-2.3 與 Ovi 也已有可下載的同步音畫權重。若 MiniMax 釋出完整、可依法使用且能本地推論的 H3 系統,它真正可能新增的價值,才是把 Seedance 式的廣泛 reference/編輯能力、15 秒、2560×1440 級輸出與雙聲道音畫,整合成可自行部署的方案。這個命題要看 license、參數量、VRAM、量化、推論速度與 API 品質能否重現。想看「權重落地」和「一般人跑得動」為何是兩回事,可對照 Kimi K3 權重正式落地分析。
AlphaLab 判斷:真正的進展不是 2K,而是 context
從第一性原理看,影片製作的瓶頸不是只有單次畫質,而是每次修改要跨多少工具、重做多少素材、丟掉多少已經正確的部分。若角色、動作、運鏡、聲音和風格都能在同一個 context 裡被語言指定,H3 可能降低的是協調成本與迭代次數,這比規格表多一個「2K」更有價值。
目前證據讓我們願意把 H3 放進「值得立刻測 API」的名單:規格與價格可核對,外部盲測也支持它的輸出競爭力。但我們不接受「commercial-grade」已被證明,也不把預告中的權重當成已開放。這和 開放權重模型的產業戰線裡反覆出現的問題相同:能下載什麼、用什麼授權、需要多少算力,才決定「開放」是否有實質意義。
現在怎麼測,才不會只重播官方 demo?
- 固定素材與 prompt,至少跑 20 次:記錄角色一致、動作完成、聲畫同步、文字正確與可交付比例,不挑一支最好看的。
- 把「編輯」拆成局部任務:只換衣服、只換背景、只改運鏡、只換聲音,檢查未指定區域是否被連帶改寫。
- 計算有效成片成本:把 output、video reference、重跑次數與人工修正時間都算進去;US$1.95 只是一次 15 秒空白起跑價。
- 等權重後做 API 對照:固定素材與 prompt,在本地與 API 各自重複多次,比較成功率與輸出分布。現行 V2 API 沒有
seed欄位,不能做同 seed 配對;另外還要核對 license、VRAM 與推論時間。
我的結論是:MiniMax H3 已是一個有外部品質訊號、價格具競爭力的統一多模態影片 API;它還不是一個已被社群驗證、可以自行部署的開放權重模型。如果權重如期落地,且能在合理硬體上重現 API 的 reference fidelity,H3 才會從「好用的產品發布」升級成影片生成基礎設施的重要轉折。
