
目次
MiniMax H3の参照素材からの動画生成では、各素材の役割を明記すると結果が安定します。画像は外観や構図、動画は動きやカメラワーク、音声は声や音の特徴に使い、保持する要素、反映する要素、変更する要素、弱く参照する要素を分けて指定します。
1つの素材から複数の被写体や特徴を取り出すことはできます。「1素材1役割」は、それぞれに主な責任を1つ決めるための計画方法であり、技術上の制限ではありません。
Reference-to-Video(Ref2VA)は、テキストと参照画像・動画・音声を使って、新しい音声付き動画を生成する方式です。素材ごとに、人物や商品の同一性、外観、スタイル、動き、カメラ、タイミング、声、効果音、音楽を導く役割を与えられます。
H3は、すべてのファイルをフレームとして扱うわけではありません。画像で外観を定め、動画でカメラワークを示し、音声で音色を導けます。
MiniMaxの公式完全参照プロンプトガイドでは、ラベル、保持マーカー、6セクションの計画形式を使って、こうした関係を定義しています。
その形式は、意図された関係を記述します。同一性の完全な維持、物理挙動、リップシンク、タイミング、テキスト、ピクセル単位の再現を保証するものではありません。
入力画像を最初のフレーム、最後のフレーム、またはその両方に固定したい場合はFL2VAを選びます。参照素材を固定フレームではなく、属性や動きのガイドとして使う場合はRef2VAを選びます。
| 目的 | 推奨H3モード | 理由 |
|---|---|---|
| 1枚の冒頭画像からスタート | FL2VA(I2VA:最初のフレーム) | 入力画像が冒頭の状態を固定します |
| 指定した1枚の終了画像に到達する | FL2VA(L2VA:最後のフレーム) | プロンプトで最終状態までの変化を設計します |
| 最初と最後の画像の両方を制限する | FL2VA(最初と最後のフレーム) | 開始と終了の両方が明示されます |
| 複数の素材から同一性、スタイル、動き、カメラ、音を参照する | Ref2VA | 素材ごとに別の参照役割を割り当てられます |
| 1つのリクエストで最初/最後のフレームのAPI役割と参照役割を併用する | 1回のAPIリクエストでは非対応 | 公式APIでは、この2種類の役割を同時に指定できません |
Video Generation V2 APIリファレンスでは、開始/終了フレームと参照メディアを別の役割として扱います。1回のAPIリクエストで両方を混在させることはできません。
参照素材を増やすたびに、H3が解釈する関係も増えます。
アップロード前に、次の5項目を確認してください。
背景が整理された商品写真は、複雑なコラージュより形状を安定して導きやすくなります。安定した動きのクリップは、速いモンタージュよりもカメラの意図をよりよく伝えます。
参照素材を集める前にショットを設計します。このAIストーリーボードガイドを使うと、アニメーション前に構図、動作、カメラの判断を整理できます。
MiniMaxの現在のH3リポジトリとモデル文書には、次のローカルRef2VA上限が記載されています。
ホスト型APIでは、すべてのリクエストに空ではないテキストプロンプトが必要です。現在のリクエスト本文の上限は64MBです。
APIの参照画像にはJPG、JPEG、PNG、WEBP、HEIC、HEIFを使用できます。参照動画はMP4またはMOV、参照音声はWAVまたはMP3に対応します。
APIのアップロード要件は変わる可能性があります。送信前に最新のVideo Generation V2 APIリファレンスを確認してください。
MiniMaxは、ローカル推論の選択肢の1つとしてComfyUIを挙げています。ローカル入力とホスト型APIでは、リクエスト規則が異なる場合があります。
プロンプトを書く前に参照素材の役割シートを作り、各ファイルに主な役割を1つ、必要なら副次的な役割を1つ割り当てます。
| 参照素材またはラベル | 適した主な役割 | 保証されないもの |
|---|---|---|
<Subject N> | 参照素材から抽象化された再利用可能な人物、オブジェクト、環境、アクション、ポーズ、エフェクト、またはスタイル | 同一性の完全な固定、または個別にアップロードしたファイルとの同一性 |
<Picture N> | 具体的なフレーム、構図、絵コンテアンカー、空間配置、または照明アンカー | 完全な動き、時間的な構造、または完全なジオメトリの保持 |
<Video N> | 参照素材編集、継続、モーションパターン、カメラパス、カット、リズム、または時間構造 | 置き換え、物理挙動、ピクセル単位の複製を保証するものではありません |
<Audio N> | 声の音色、ビート、対話信号、音響効果、音楽の特徴、連続性、または直接音声の再利用 | リップシンクの保証、または音声だけのローカルRef2VA入力 |
ワークシートの形式は次のとおりです。
| 素材ID | タイプ | 利用許諾 | 主な役割 | 副次的な役割 | 保持・反映・変更 | 対象ショット | 矛盾または合否確認 |
|---|---|---|---|---|---|---|---|
| Picture 1 | 画像 | はい | ボトルの外観とラベル | 素材の色 | 形状とマットブラックのキャップを保持 | すべてのショット | ラベルは正面を向いたままになります |
| Picture 2 | 画像 | はい | 温室環境 | 夜明けの色調 | 小物は使わず、環境だけを反映 | すべてのショット | 2番目の製品は表示されません |
| Video 1 | 動画 | はい | 時計回りのカメラの円運動 | 遅いペース | カメラ経路だけを反映 | ショット1 | ボトルには参照動画側の形状を反映しない |
| Audio 1 | 音声 | はい | ガラスチャイムのテクスチャ | 最後のアクセントのタイミング | 音色を参照し、元の信号はコピーしない | ショット2 | キャップのクリック音の後に澄んだチャイムを1回鳴らす |
合否基準を設けると、各役割を個別に確認できます。
商品動画では、製品と動画の一貫性ガイドを参考に、形状とラベルの確認項目も追加してください。
この指示では優先順位が明確ではありません。
Use the silver cap from Picture 1 and the black cap from Picture 2. Keep both exact.
次のように書くと、役割が明確になります。
Picture 1 controls the bottle geometry, amber glass, matte-black cap, and label. Picture 2 controls only the greenhouse environment and dawn lighting; ignore the container shown in Picture 2.
参照動画の動きが映っている人物より重要なら、その境界を明記します。「Video 1は動きとカメラだけを制御し、人物と背景は参照しない」と指定します。
6つのセクションを通して、同じラベル番号を使います。
<Subject N>は、人物、製品、環境、アクション、ポーズ、インターフェース、スタイルなど、再利用または編集したい視覚要素を表します。
<Subject 1> is the square amber-glass perfume bottle whose geometry, matte-black cap, and cream "NORTHLINE" label come from <Picture 1>.
画像を具体的なフレームや構図の基準にする場合は、<Picture N>を単独で使います。
<Picture 3> is the first-frame composition anchor for [Shot 1], defining the bottle position, plinth angle, and empty space on the right.
画像がSubjectだけを定義する場合は、そのSubjectの定義内で画像を参照します。
<Video N>は、参照動画の編集、続きを作る処理、カメラ、カット、リズム、時間構造に使います。動画から取り出す人物や物体には、別途Subjectラベルが必要です。
<Audio N>は、音声、タイミング、ビート、エフェクト、音楽の特徴を直接再利用または参照する場合に使います。音声番号と動画番号は独立したままになります。
MiniMaxの完全参照ガイドでは、次の順序で6つのセクションを使います。
subject_definitionssummaryretention_analysisdetailed_descriptionoverall_soundscapenon_diegetic_musicホスト型APIにはテキストが必要ですが、すべての利用者が完全な形式を手書きする必要はありません。H3-Context-IRは自由形式のマルチモーダル入力を処理できます。6つのセクションは精密な計画用であり、必須の生APIスキーマではありません。
次の例では、MiniMaxが文書化した形式を架空の製品ショットに当てはめています。
実行カードの例:Ref2VA・8秒・16:9・画像3枚・動画1本・音声参照1本。
subject_definitions:
<Subject 1> is the square amber-glass perfume bottle whose geometry, matte-black cap, and cream "NORTHLINE" label come from <Picture 1>.
<Subject 2> is the greenhouse environment from <Picture 2>, with wet black-basalt surfaces, tall fern leaves, glass roof panels, and cold blue dawn light.
<Picture 3> is the first-frame composition anchor for [Shot 1], defining the bottle position, plinth angle, and empty space on the right.
<Video 1> provides the slow clockwise camera arc and measured pacing for [Shot 1], without providing product appearance.
<Audio 1> is the sound-texture reference for one clear glass chime heard after the cap click in [Shot 2].
summary:
[keyframe completion + reference generation + audio reference] The target video presents <Subject 1> inside <Subject 2>. It begins from the composition in <Picture 3>, follows the camera path from <Video 1>, and uses <Audio 1> only as a sound-texture reference for the final chime.
retention_analysis:
<Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved - the square amber-glass body, matte-black cap, cream "NORTHLINE" label, and front-facing product identity are retained.
<Subject 2> (appears in [Shot 1], [Shot 2]): fully_preserved - the wet basalt, fern leaves, glass roof, and cold blue dawn lighting are retained.
<Picture 3> ([Shot 1] first frame): fully_preserved - the opening bottle position, plinth angle, and right-side negative space are retained.
<Video 1> (camera path and pacing): partially_preserved - its slow clockwise arc and measured speed guide [Shot 1], while its source subjects and setting are excluded.
<Audio 1>: reference - its clean glass-chime texture guides one newly generated accent without copying the original signal.
detailed_description:
The target video uses a live-action cinematic product-film style with restrained movement and cool dawn lighting.
[Shot 1] The shot begins from <Picture 3>. <Subject 1>, the square amber-glass perfume bottle with a matte-black cap and cream "NORTHLINE" label, stands on the wet basalt plinth inside <Subject 2>. The camera follows the slow clockwise arc and measured pacing referenced from <Video 1>. Cold blue light enters from the right through the greenhouse roof. Water beads slide down the amber glass. Fern leaves move slightly behind the product. The bottle stays fixed, front-facing, and unchanged while the camera completes the arc. No second bottle, subtitle, or watermark appears.
[Shot 2] At 00:05.000, the camera cuts to a static close-up of <Subject 1>. A clean hand enters from the upper right, presses the matte-black cap down once, and releases it. The cap makes a dry click. A single newly generated glass chime follows, using the clear texture referenced from <Audio 1> without copying its signal. A narrow amber reflection crosses the cream "NORTHLINE" label from left to right. The hand exits. The bottle remains centered and readable through the final frame.
overall_soundscape:
Light rain taps on the glass roof throughout the video. Fern leaves brush softly in the background, while water drops strike the basalt and the cap produces one dry mechanical click.
non_diegetic_music:
N/A
この計画には、各参照素材が制御する要素と除外する要素が明記されています。
参照はクリップの一部のみに関係する可能性があるため、ショットごとに役割を割り当てます。
各ショットは次の順序で書きます。
最初のショットにはタイムスタンプを付けません。後続のショットでは[Shot N] At MM:SS.mmm, ...のように、カット時刻を昇順で指定します。2本の動画で動きを参照する場合は、一方を身体の動き、もう一方をカメラに割り当てます。
意図する信号の関係に合う音声マーカーを選びます。
| マーカー | 平易な言葉の意味 |
|---|---|
fully_copy | 参照素材音声全体を完全な最終音声トラックとして再利用します。 |
partially_copy | タイムラインまたは選択したレイヤーの一部をコピーし、他の場所に変更を加えます |
reference | 音色、リズム、スタイル、言葉、ビート、または音テクスチャに基づいて新しい音声を生成します |
weak_reference | 大まかなカテゴリまたは雰囲気の類似性のみを保持する |
音声で対象話者を導く場合は、detailed_descriptionで使う同じ話者ID (Sx)にひも付けます。音色だけを反映する場合は、参照元のセリフを生成結果へコピーしないでください。
ローカル版では、音声だけをH3-Base-Ref2VAの参照素材にはできません。画像または動画も追加してください。
各役割を保持、一部保持、欠落、競合の4段階で評価します。
| 確認項目 | 質問 |
|---|---|
| 同一性 | 意図した人物や物体を各ショットで識別できますか? |
| 外観 | 指定した色、衣服、素材、ラベル、スタイルが反映されていますか? |
| ジオメトリ | 製品の特徴的な形状と部品同士の関係が保たれていますか? |
| モーション | 指定した動作が意図した軌道と速度に沿っていますか? |
| カメラ | カメラは、不要な参照元の内容を継承せずに、指定した方向に動きましたか? |
| タイミング | 各参照は指定したショット範囲で開始・終了していますか? |
| 音 | 音声は計画どおりにコピー、参照、新規生成されましたか? |
| 競合 | 2つの参照素材が同じ属性を取り合っていませんか? |
一度に1つの関係だけを修正します。カメラだけが意図どおりでない場合は、Video 1がカメラのみを制御すると明記し、参照元の商品外観を除外します。
モデルの挙動を問題視する前に、公式情報と自分の役割計画を確認してください。
キャッシュ、量子化、ステップ数、ノード、VRAMは、特定のローカル環境に影響する場合があります。実際の影響は設定によって異なります。
ローカルのH3-Baseは、ネイティブのステレオ音声を含む768p動画を生成します。公開版にはFL2VAとRef2VAの個別チェックポイントが含まれます。
完全なシステムには、ホスト型のH3-Context-IRとH3-Regenerate-2Kも含まれます。Regenerate-2Kは、768pの結果と元のコンテキストを使って最大2Kで再生成します。
Regenerate-2Kは従来型のアップスケーラーではなく、現在のオープンウェイト公開にも含まれていません。そのため、Ref2VAだけをダウンロードしても、完全なローカル2Kワークフローは利用できません。
FL2VAは最初のフレーム、最後のフレーム、または両方を固定します。Ref2VAは参照画像・動画・音声に、同一性、スタイル、動き、カメラ、タイミング、音の役割を割り当てます。
モデルカードでは、画像は最大9枚、動画は3本、音声は3本、混在時は合計12ファイルまでです。動画と音声は、それぞれ合計15秒を超えられません。
文書化されたローカルRef2VAワークフローではできません。参照音声には画像または動画を組み合わせる必要があります。ホスト型APIには別のリクエスト規則があります。
いいえ。APIにはテキストが必要ですが、6つのセクションを手作業ですべて送る必要はありません。この構造は精密な計画方法として使えます。
動画は動きのパターン、カメラの軌道、リズム、時間構造をガイドできます。完全な再現を保証するものではないため、ガイドとして扱ってください。
H3-Baseのローカル出力は768pです。公式の2K経路では、現在のオープンウェイト公開に含まれないホスト型Regenerate-2Kを使用します。
次のRef2VAリクエストを送る前に参照素材の役割シートを作り、各素材に主な役割を1つ与えて、最初の出力を役割ごとに確認します。
MiniMax H3は近日中にDomoAIで利用可能になる予定です。利用可能になり次第、お知らせします。
最近の記事
© 2025 ドメインページ(株)
どーもあい