
內容表
MiniMax H3 是 MiniMax 的通用全模態系統,可依據文字、圖片、影片與音訊脈絡,生成帶有原生立體聲音訊的影片。MiniMax M3 是另一款用於程式開發與代理工作的模型。Hailuo AI 是面向使用者的產品介面,Hailuo 2.3 則是較早推出的影片模型。
H3 剛推出不久,因此存取方式與特定實作所提供的控制項目仍可能變動。
MiniMax 於 2026 年 7 月 31 日推出 H3,並將其描述為通用多模態生成模型。目前的模型卡採用更精確的名稱:「全模態生成系統」。
兩種說法表達的是同一件事:H3 能在單一脈絡中理解多種媒體,並同時生成短片與原生立體聲音訊。
MiniMax H3 官方發表文章與 H3 模型卡列出以下現行規格:
| 項目 | 現行規格 | 適用範圍 |
|---|---|---|
| 正式模型名稱 | MiniMax H3 | MiniMax 發表頁面與模型卡 |
| API 模型 ID | MiniMax-H3 | 託管式 Video Generation V2 API |
| 脈絡輸入 | 文字、圖片、影片與音訊 | 實際組合依模式與存取介面而定 |
| 文件記載的輸出 | 帶有原生立體聲音訊的影片 | 託管式 API 與已釋出的 H3-Base checkpoint |
| 片長 | 4–15 秒 | 託管式 API 規格 |
| 幀率 | 24 fps | H3 模型卡 |
| 音訊 | 32 kHz 立體聲 | H3 模型卡 |
| 解析度 | H3-Base 生成 768p;H3 可透過 Regenerate-2K 或端對端 API 達到最高 2K | 不要把本機 H3-Base 視為完整的 2K 系統 |
| 開放權重 | H3-Base FL2VA 與 H3-Base Ref2VA | 依自訂授權釋出的開放權重 |
「全模態」不代表所有 MiniMax 產品都已合併至同一個端點。目前文件記載的 H3 API 與已釋出的 checkpoint,重點是同時輸出影片與音訊。
H3 的訓練涵蓋更廣泛的任務,但這不代表已有獨立公開的純圖片、純音樂或純音訊 H3 產品。判斷功能時,應以現行產品介面為準,而非只看訓練任務清單。
理解這些名稱最簡單的方法,是把模型與產品分開。MiniMax 是公司;H3 與 M3 是不同模型;Hailuo AI 是創作應用程式,Hailuo 2.3 則是一款特定的影片模型。
| 名稱 | 類型 | 主要用途 | 關鍵差異 |
|---|---|---|---|
| MiniMax H3 | 通用全模態生成系統 | 依多模態脈絡生成影片與原生立體聲音訊 | 正式 API ID 為 MiniMax-H3 |
| MiniMax M3 | 另一款原生多模態模型 | 程式開發、代理工作、電腦操作與長脈絡任務 | 可接收圖片與影片,但官方定位與 H3 不同 |
| Hailuo AI | MiniMax 面向使用者的網頁應用程式 | 提供媒體生成介面給創作者 | MiniMax 將其列為 H3 的官方線上應用程式 |
| Hailuo 2.3 | 2025 年 10 月推出的 MiniMax 影片模型 | 影片生成 | MiniMax 表示它以 Hailuo 02 為基礎 |
| 「Hailuo H3」或「Hailuo 3.0」 | 搜尋與社群用語 | 協助部分使用者找到新版本 | MiniMax 並未將這些名稱用作 H3 的正式模型名稱 |
釐清這些名稱,就能避免兩個常見誤解:H3 不是 M3 的影片版本,Hailuo 2.3 也不是 H3 的另一個正式名稱。
H3 與 M3 都能處理多種輸入。「多模態」這個共同特徵,正是許多混淆的來源。
實際差異在於兩者負責的工作與輸出。
| 比較面向 | MiniMax H3 | MiniMax M3 |
|---|---|---|
| 主要輸出 | 帶有原生立體聲音訊的短片 | 回答、程式碼、推理與工具驅動的任務結果 |
| 主要任務規模 | 4–15 秒的目標片段 | 使用最多 100 萬 token 脈絡的程式開發與代理工作 |
| 典型用途 | 生成場景、商品短片、海報動畫或參考素材驅動的影片 | 程式碼、分析、電腦操作或長時間執行的代理任務 |
MiniMax 的M3 官方發表文章稱 M3 為原生多模態模型。它可接收圖片與影片,因此把 M3 說成純文字模型並不正確。
不過,支援這些輸入並不會讓 M3 變成 H3 的影片端點。MiniMax 將 M3 定位於程式開發與代理工作,H3 則定位於影音生成。
以產品發布專案為例,M3 可檢查設計摘要、審閱 UI 螢幕截圖、分析程式庫或協助協調任務。H3 則可利用商品圖片、動作參考素材與音訊指示生成短片。
兩款模型能支援同一個大型專案,但扮演的角色並不相同。
Hailuo 同時出現在產品與模型命名中,因此兩者的關係不像 H3 與 M3 的差異那麼直觀。
MiniMax 在 H3 程式庫的「Online App」區段連結至 Hailuo AI。這是讓使用者存取 MiniMax 媒體生成功能的產品介面。
但這不代表每個底層模型的正式 API 名稱都是 Hailuo。產品名稱與模型名稱可以各自存在。
MiniMax 於 2025 年 10 月 28 日發表 Hailuo 2.3。官方發表文章表示,這款模型以 Hailuo 02 為基礎。
MiniMax 當時著重介紹物理動態、風格化、角色細微表情,以及對動作指令的回應。這些說法都出自 MiniMax 的發表資料。
Hailuo 2.3 與 H3 各有不同的正式名稱和發表頁面。現有資料並未指出 H3 是 Hailuo 2.3 的重新命名版本,或已直接取代它。
部分第三方頁面與使用者把新模型稱為「Hailuo H3」「Hailuo 3.0」或「Hailuo 03」。這些用語有助於理解搜尋意圖,卻不應被當成產品正式名稱。
截至 2026 年 8 月 7 日,MiniMax 發表頁面與模型卡在內文中都使用「MiniMax H3」。Video Generation V2 API 所需的模型 ID 是 MiniMax-H3。
H3 在同一個影片生成系統下支援多種輸入方式。適合的方式取決於從概念、單一畫面,還是多項參考素材開始。
使用文字生成影片時,可描述主體、動作、場景、鏡頭運動、對話、音效、環境聲與音樂。H3 會同時生成視覺與音訊軌道。
這不同於先生成無聲影片,也不同於完成生成後才加上素材音訊。原生音訊讓模型把畫面動作與聲音視為同一個目標序列的一部分。
這不保證每次都能準確生成對話、聲音時間點或音樂,只表示模型會聯合表達這些輸出通道。
H3-Base FL2VA checkpoint 支援零張、一張或兩張輸入圖片。
這些模式能從核准的構圖開始,或指定轉場的起點與終點,但無法保證每個中間幀都完整保留來源細節。
H3-Base Ref2VA checkpoint 可在文字之外接收參考圖片、影片與音訊。每項素材都能引導結果中的不同部分。
例如,圖片可以定義角色或商品,影片可以引導動作或鏡頭運動,音訊片段則可以引導聲音、節奏或聲音關係。
MiniMax 的官方範例結合了一段影片的鏡頭運動、一張圖片中的角色,以及音訊素材中的歌聲。模型會透過文字解讀這些素材之間的關係。
模型卡限制了參考素材的數量與長度,也指出在本機 Ref2VA 工作流程中,參考音訊不能成為唯一的媒體輸入。
H3 目前可生成 4–15 秒的片段。模型卡記載的規格為 24 fps 與 32 kHz 立體聲。
H3-Base 輸出 768p。MiniMax 記載的 2K 工作流程會把 H3-Base 與託管式 Context-IR、Regenerate-2K API 搭配使用。端對端 Video Generation V2 API 也能傳回 2K 輸出。
目前請求與輸出選項,仍應以官方 Video Generation V2 API 參考文件為準。
MiniMax 表示早期測試在指令遵循、文字渲染、品牌渲染與影片動作轉移方面表現良好。這些是供應商自行公布的說法,並非本文的獨立測試結果。
完整 H3 系統包含三個部分。了解各部分的邊界,就能看清 2K 工作流程與開放權重的實際範圍。
文字+圖片+影片+音訊
│
▼
H3-Context-IR — 託管式脈絡解讀
│
▼
H3-Base — 公開權重,生成 768p 影音
│
▼
H3-Regenerate-2K — 託管式脈絡感知 2K 再生成
Context-IR 會解讀輸入媒體與目標輸出的關係,H3-Base 接著生成 768p 影片與立體聲音訊。Regenerate-2K 再利用這項結果與原始脈絡建立較高解析度的版本。
MiniMax 已公開 H3-Base FL2VA 與 Ref2VA 的權重。目前的開放權重版本不包含 Context-IR 或 Regenerate-2K。
因此,就完整 H3 系統而言,「開放權重」比「完全開源」更精確。可下載內容受自訂的 MiniMax H3 Community License 規範。
H3 支援廣泛脈絡,但並未消除生成影片常見的限制。
首先,每次輸出長 4–15 秒。較長的廣告、電影或商品故事仍需要多個鏡頭與剪輯時間軸。
其次,控制方式會隨存取介面而異。上游模型具備某項能力,不代表每個應用程式都提供相同的輸入角色、設定或上限。
第三,參考輸入只會引導結果,不保證精確複製。複雜動作、對話、小字、身分一致性與來源素材之間的關係仍需檢查。
最後,MiniMax 表示 H3 在多模態理解、模型規模與視覺細節方面仍有改進空間。這項說明出現在該公司的發表路線圖中。
應把發表範例視為示範,而非保證。選定製作流程前,請用實際的主體、參考素材、文字、對話與動作進行測試。
MiniMax 將 H3 定位為短篇影音製作模型。官方範例涵蓋電影片頭、商品頁面、動畫海報、廣告與電子商務。
該公司也把品牌設計、產品設計、UI/UX 與遊戲列為目標領域。實際用途包括:
H3 仍以短片為主要輸出。較長的故事需要鏡頭規劃、多次生成、審閱與剪輯。
這些名稱其實不難區分:影音生成模型是 MiniMax H3,程式開發與代理工作使用 MiniMax M3,面向使用者的產品是 Hailuo AI,較早的影片模型則是 Hailuo 2.3。
MiniMax H3 即將加入 DomoAI;正式上線後,我們會再公布消息。
最近的文章