
內容表
使用 MiniMax H3 參考素材生成影片時,請先為每項素材指定明確角色。圖片用來引導外觀或構圖,影片用來引導動作或攝影機,音訊用來引導聲音;並說明 H3 應保留、套用、修改或弱化參考哪些內容。
一項素材可以提供多個主體或屬性。「一項素材、一個主要角色」是為各素材明確分工的規劃方法,不是技術限制。
Ref2VA 使用文字搭配參考圖片、影片或音訊來引導新的影音片段。各項素材可以分別引導身分、外觀、風格、動作、攝影機、時間、語音、音效或音樂。
H3 不會把每個檔案都視為一個畫面。圖片可定義外觀,影片可引導攝影機,音訊則可引導音色。
MiniMax 的官方完整參考提示指南以標籤、保留標記與六個區段的規劃格式,明確定義這些關係。
這套格式描述的是預期關係,無法保證身分完全一致、物理效果、唇形同步、時間、文字或逐像素重現。
當輸入圖片必須成為第一幀、最後一幀或兩者時,請選擇 FL2VA。若參考素材只需引導屬性或動作,而不是作為固定端點,請選擇 Ref2VA。
| 需求 | 建議的 H3 模式 | 原因 |
|---|---|---|
| 從一張起始圖片開始 | 第一幀 I2VA 模式下的 FL2VA checkpoint | 輸入圖片固定起始狀態 |
| 以指定的結尾圖片收尾 | L2VA 模式下的 FL2VA checkpoint | 提示詞描述從起始狀態到最終狀態的變化 |
| 約束第一張和最後一張圖片 | 第一幀和最後一幀模式下的 FL2VA checkpoint | 兩個端點都是明確的 |
| 使用多項素材中的身分、風格、動作、攝影機或聲音 | Ref2VA | 每項素材可分配不同的參考角色 |
| 在一個請求中混合第一幀/最後一幀 API 角色與參考角色 | 單一 API 請求不支援 | 官方 API 將這些角色系列視為互斥的 |
Video Generation V2 API 參考文件將端點幀角色與參考媒體角色分開;同一個 API 請求不能混用這兩類角色。
每增加一項參考素材,H3 就多一組需要理解的關係。
上傳前請檢查以下五項:
背景乾淨的產品照通常比複雜拼貼更能穩定引導產品形狀。穩定的運動剪輯比快速蒙太奇更好地傳達攝影機意圖。
在收集參考資料前規劃拍攝。這個 AI分鏡指南 有助於在製作動畫之前分離構圖、動作和攝影機決策。
MiniMax 目前的 H3 儲存庫和模型檔案列出了這些本機 Ref2VA 限制:
託管式 API 要求每個請求中都有非空文字提示。其目前請求內文限制為 64 MB。
API 參考影像可以使用 JPG、JPEG、PNG、WEBP、HEIC 或 HEIF。參考影片接受 MP4 或 MOV,而參考音訊則接受 WAV 或 MP3。
API 上傳要求可能會發生變化,因此請在提交請求前查看目前的 Video Generation V2 API 參考文件。
MiniMax 將 ComfyUI 列為本機推理選項之一。本機輸入規則和託管式 API 請求規則可能不同。
在編寫提示之前建立參考素材角色表。為每個檔案分配一項主要角色,並在需要時分配一項次要角色。
| 參考素材或標籤 | 適合的主要角色 | 不保證的結果 |
|---|---|---|
<Subject N> | 從來源中提取的可重複使用的人物、物件、環境、動作、姿勢、效果或風格 | 完全鎖定身分,或等同於一個單獨上傳的檔案 |
<Picture N> | 具體畫面、構圖、故事板錨點、空間佈置或燈光錨點 | 完整的運動、時間結構或完美的幾何保留 |
<Video N> | 來源編輯、延續、運動模式、攝影機路徑、剪輯、節奏或時間結構 | 保證完成替換、符合物理效果或逐像素複製 |
<Audio N> | 語音音色、節拍、對話訊號、音效、音樂特徵、連續性或直接音訊重複使用 | 保證唇形同步,或支援純音訊的本機 Ref2VA 輸入 |
這是工作表格式:
| 素材ID | 類型 | 是否已取得使用權? | 主要角色 | 次要角色 | 保留、套用或修改 | 鏡頭範圍 | 衝突或驗收檢查 |
|---|---|---|---|---|---|---|---|
| Picture 1 | 圖片 | 是 | 瓶子外觀及標籤 | 材質顏色 | 保留瓶身形狀與霧面黑色瓶蓋 | 所有鏡頭 | 標籤保持正面 |
| Picture 2 | 圖片 | 是 | 溫室環境 | 黎明調色板 | 只套用環境,不套用其中的道具 | 所有鏡頭 | 沒有出現第二個產品 |
| Video 1 | 影片 | 是 | 順時針攝影機弧 | 節奏緩慢 | 只套用攝影機路徑 | 鏡頭1 | 瓶子不繼承來源形狀 |
| Audio 1 | 音訊 | 是 | 玻璃鈴音色 | 最後提示音的時間 | 參考音色,不複製原始訊號 | 鏡頭2 | 按下蓋子後發出一道清脆的鈴聲 |
加入驗收條件後,便能逐項檢查每個角色是否生效。
製作產品影片時,可參考產品影片一致性指南,加入形狀與標籤檢查。
這段指示沒有明確優先順序:
Use the silver cap from Picture 1 and the black cap from Picture 2. Keep both exact.
此版本分配責任:
Picture 1 controls the bottle geometry, amber glass, matte-black cap, and label. Picture 2 controls only the greenhouse environment and dawn lighting; ignore the container shown in Picture 2.
當參考表演比表演者更重要時,請明確劃定範圍:Video 1 只控制動作與攝影機,忽略其中的表演者與場景。
保持所有六個部分的標籤編號穩定。
<Subject N> 指可重複使用或可編輯的可見內容,例如人物、產品、環境、動作、姿勢、介面或風格。
<Subject 1> is the square amber-glass perfume bottle whose geometry, matte-black cap, and cream "NORTHLINE" label come from <Picture 1>.
當圖片用作具體畫面或構圖基準時,請單獨使用 <Picture N>。
<Picture 3> is the first-frame composition anchor for [Shot 1], defining the bottle position, plinth angle, and empty space on the right.
如果圖片只用來定義主體,請在 Subject 定義中引用該圖片。
以 <Video N> 表示參考影片的剪輯、延續、攝影機、轉場、節奏或時間結構。從影片取用的人物或物體仍須使用 Subject 標籤。
使用 <Audio N> 表示直接重複使用音訊,或參考聲音、時間、節拍、音效與音樂特徵。Audio 與 Video 的編號彼此獨立。
MiniMax 的完整參考指南按以下順序使用六個部分:
subject_definitionssummaryretention_analysisdetailed_descriptionoverall_soundscapenon_diegetic_music託管式 API 需要文字提示詞,但不要求每位使用者都手動撰寫完整內容。H3-Context-IR 可處理自由格式的多模態輸入;這六個區段是精確的規劃語言,不是強制使用的原始 API 結構。
以下原創範例把 MiniMax 文件中的格式套用到虛構產品鏡頭。
執行卡片範例: Ref2VA · 8 秒 · 16:9 · 三張圖片 · 一段影片 · 一段音訊參考。
subject_definitions:
<Subject 1> is the square amber-glass perfume bottle whose geometry, matte-black cap, and cream "NORTHLINE" label come from <Picture 1>.
<Subject 2> is the greenhouse environment from <Picture 2>, with wet black-basalt surfaces, tall fern leaves, glass roof panels, and cold blue dawn light.
<Picture 3> is the first-frame composition anchor for [Shot 1], defining the bottle position, plinth angle, and empty space on the right.
<Video 1> provides the slow clockwise camera arc and measured pacing for [Shot 1], without providing product appearance.
<Audio 1> is the sound-texture reference for one clear glass chime heard after the cap click in [Shot 2].
summary:
[keyframe completion + reference generation + audio reference] The target video presents <Subject 1> inside <Subject 2>. It begins from the composition in <Picture 3>, follows the camera path from <Video 1>, and uses <Audio 1> only as a sound-texture reference for the final chime.
retention_analysis:
<Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved - the square amber-glass body, matte-black cap, cream "NORTHLINE" label, and front-facing product identity are retained.
<Subject 2> (appears in [Shot 1], [Shot 2]): fully_preserved - the wet basalt, fern leaves, glass roof, and cold blue dawn lighting are retained.
<Picture 3> ([Shot 1] first frame): fully_preserved - the opening bottle position, plinth angle, and right-side negative space are retained.
<Video 1> (camera path and pacing): partially_preserved - its slow clockwise arc and measured speed guide [Shot 1], while its source subjects and setting are excluded.
<Audio 1>: reference - its clean glass-chime texture guides one newly generated accent without copying the original signal.
detailed_description:
The target video uses a live-action cinematic product-film style with restrained movement and cool dawn lighting.
[Shot 1] The shot begins from <Picture 3>. <Subject 1>, the square amber-glass perfume bottle with a matte-black cap and cream "NORTHLINE" label, stands on the wet basalt plinth inside <Subject 2>. The camera follows the slow clockwise arc and measured pacing referenced from <Video 1>. Cold blue light enters from the right through the greenhouse roof. Water beads slide down the amber glass. Fern leaves move slightly behind the product. The bottle stays fixed, front-facing, and unchanged while the camera completes the arc. No second bottle, subtitle, or watermark appears.
[Shot 2] At 00:05.000, the camera cuts to a static close-up of <Subject 1>. A clean hand enters from the upper right, presses the matte-black cap down once, and releases it. The cap makes a dry click. A single newly generated glass chime follows, using the clear texture referenced from <Audio 1> without copying its signal. A narrow amber reflection crosses the cream "NORTHLINE" label from left to right. The hand exits. The bottle remains centered and readable through the final frame.
overall_soundscape:
Light rain taps on the glass roof throughout the video. Fern leaves brush softly in the background, while water drops strike the basalt and the cap produces one dry mechanical click.
non_diegetic_music:
N/A
這份計畫明確指出每項素材控制與排除的內容。
請按鏡頭分配角色,因為參考素材可能只在片段的一部分生效。
每個鏡頭依照以下順序撰寫:
第一個鏡頭沒有時間戳。後面的鏡頭使用 [Shot N] At MM:SS.mmm, ... 並依時間順序標示剪接點。如果兩個影片引導運動,請將身體動作分配給一個,將攝影機分配給另一個。
選擇與預期訊號關係相符的音訊標記。
| 標記 | 白話含義 |
|---|---|
fully_copy | 重複使用整個來源音訊作為完整的最終音軌 |
partially_copy | 複製部分時間軸或選定圖層,並在其他地方進行更改 |
reference | 根據音色、節奏、風格、單字、節拍或聲音紋理生成新的音訊 |
weak_reference | 只保留大致類別或氛圍上的相似性 |
當音訊用來引導目標說話者時,請使用與 detailed_description 相同且固定的 (Sx) 說話者 ID。如果僅傳輸音色,請勿將來源對話複製到目標中。
請記住本機限制:音訊不能是 H3-Base-Ref2VA 的唯一媒體參考,必須同時加入圖片或影片。
將每項預期角色標記為已保留、部分保留、缺失或衝突。
| 檢查 | 問題 |
|---|---|
| 身分 | 鏡頭中的預期人物或物體是否仍可辨識? |
| 外觀 | 指定的顏色、服裝、材質、標籤或款式是否存在? |
| 幾何 | 產品是否保持其定義的形狀和零件關係? |
| 運動 | 所請求的行動是否遵循預期的路徑和節奏? |
| 攝影機 | 攝影機是否使用了請求的方向而沒有繼承不需要的來源內容? |
| 時機 | 每項參考是否在指定的鏡頭範圍內開始與停止生效? |
| 聲音 | 音訊是否依計畫複製、參考或重新生成? |
| 衝突 | 兩個參考素材是否競爭相同的屬性? |
一次修改一個關係。如果只有攝影機效果不符預期,請明確指定 Video 1 只控制攝影機,並排除其中的產品外觀。
判定模型行為有問題前,先核對官方文件與自己的角色計畫。
快取、量化、步數、節點與 VRAM 都可能影響本機結果,實際影響會依設定而異。
本機 H3-Base 生成帶有原生立體聲音訊的 768p 影片。公開版本包括單獨的 FL2VA 和 Ref2VA checkpoint。
完整系統還包括託管式 H3-Context-IR 與 H3-Regenerate-2K。Regenerate-2K 使用 768p 結果加上原始脈絡以高達 2K 的解析度重新產生。
Regenerate-2K 不是傳統的畫質提升工具,並且不在目前的開放權重版本中。因此,單獨下載 Ref2VA 並不能提供完整的本機 2K 工作流程。
FL2VA 錨定第一幀、最後一幀或兩者。Ref2VA 為參考圖片、影片與音訊指派身分、風格、動作、攝影機、時間或聲音角色。
本機模型卡列出最多 9 張圖片、3 段影片與 3 段音訊;混合使用時最多 12 個檔案。影片與音訊各自的總長度都不得超過 15 秒。
文件記載的本機 Ref2VA 工作流程不支援。參考音訊必須搭配圖片或影片;託管式 API 另有一套請求規則。
不需要。API 要求文字提示詞,但使用者不必手動提交全部六個區段。這套結構是一種精確的規劃方法。
影片可以引導動作模式、攝影機路徑、節奏或時間結構,但應視為參考,而非保證完全重現。
H3-Base 在本機生成 768p。官方 2K 流程依賴目前開放權重版本未包含的託管式 Regenerate-2K。
下次送出 Ref2VA 請求前,先建立參考素材角色表,為每項素材指定一個主要角色,再依角色檢查第一個輸出。
MiniMax H3 即將在 DomoAI 提供;上線後會另行公布。
最近的文章