內容表
MiniMax H3 能將來源圖片轉成短影片。要提高結果的穩定度,請先準備乾淨的靜態圖片、以動作為主的提示詞,以及明確的結尾設計。本指南將說明來源圖片準備、首尾影格、參考媒體、檢查方法與常見問題的修正方式。
圖片轉影片會以一張靜態圖片作為動作的視覺起點。來源圖片已決定主體、構圖、色盤、照明,以及大部分的場景空間關係。
提示詞要說明接下來會發生什麼。你可以指定主體動作、相機運動、環境變化、節奏與預期的結尾。
MiniMax 官方 API 將此模型列為 MiniMax-H3。它支援 768P 或 2K 輸出、4~15 秒片長與原生立體聲音訊。官方文件列出的流程包括文字轉影片、以第一影格進行圖片轉影片、首尾影格生成,以及多模態 Reference Generation。
使用 H3 仍然需要事前規劃。四肢被遮住、文字已損壞,或景深線索互相衝突,都會增加動作不穩與畫面漂移的風險。
好看的靜態圖片不一定適合拿來做動畫。請把它當成鏡頭的第一影格來檢查。
先修好來源圖片,再投入 Credits 生成影片。DomoAI 的 多模型圖片生成器與編輯器 可修正手部、文字、服裝、背景與產品細節,並提供 GPT Image 2、Nano Banana 2 與 Nano Banana Pro。
不要一次修改所有問題。每次只調整一個肉眼可見的問題,檢查結果,並保留已核准的主體設計。
圖片已經告訴模型場景裡有什麼。提示詞應用來定義動作與限制條件。
可以採用以下結構:
Subject action + camera movement + environmental motion + timing + locked details + forbidden changes
以下產品展示提示詞為每個部分安排了明確用途:
Animate this source image into a 6-second cinematic product reveal. Keep the same subject, color, logo placement, and background layout. Start with a slow push-in, add soft reflections on the surface, then finish with a slight camera arc from left to right. No new objects, no text changes, no face or logo distortion.
提示詞沒有重新描述每種顏色或物件,而是保護重要細節並引導鏡頭。
角色場景可以這樣寫:
The same character looks toward the window and takes one slow breath. Her hair moves slightly in the evening breeze. The camera makes a gentle push-in. Keep her face, outfit, room layout, and cel-shaded style unchanged. No new characters or sudden camera shake.
第一次測試只安排一個主要主體動作與一種相機運動。基本鏡頭穩定後,再逐步增加複雜度。

每個提示詞組成部分,都應負責引導一項鏡頭內容,或保護一個必須維持穩定的細節。
只有起始圖片時,最後的構圖仍是開放的。若鏡頭必須停在特定產品角度、姿勢、版面或轉場位置,請加入最後一影格。
| 鏡頭需求 | 只有起始圖片 | 首尾影格 |
|---|---|---|
| 角色的輕微自然動作 | 通常已足夠 | 可選 |
| 緩慢推鏡 | 通常已足夠 | 需要精準控制結尾取景時使用 |
| 產品轉動或亮相 | 結果較難預測 | 較適合指定明確的結尾角度 |
| 前後狀態轉換 | 終點控制較弱 | 可定義前後兩種狀態 |
| 相似構圖剪接或轉場 | 結尾可能漂移 | 可支援預先規劃的剪接點 |
| 以標誌或產品定鏡收尾 | 版面可能改變 | 有助於保護最終構圖 |
兩個影格必須呈現合理的轉換。正面產品圖與毫不相關的俯視場景差異過大,會迫使模型自行補出太多中間內容。
若要在 MiniMax 以外規劃首尾畫面,可使用 DomoAI 的 多幀轉影片 。其中有兩種相關流程:ByteDance 的 Seedance 2.0 模式使用起始與結束影格;DomoAI 2.4.1 則支援 2~8 個關鍵影格,以及各段獨立提示詞。
參考素材應用來消除歧義,而不是把整個未整理的素材資料夾全部塞進去。
Reference Generation 可使用視覺參考,以及與視覺媒體搭配的選用音訊。目前 API 最多接受 9 張參考圖片、3 段影片與 3 段音訊,混合參考輸入合計上限為 12 個檔案。每段影片或音訊須為 2~15 秒;參考影片與參考音訊各自的總長度上限均為 15 秒。MiniMax 的 H3 參考文件指出,音訊至少要搭配 1 張圖片或 1 段影片,不能作為唯一的參考輸入。
H3-Context-IR 是獨立的非同步步驟,會解讀多模態情境並回傳增強後的提示詞;它不會生成影片。
為每項參考素材指定一個用途:
移除與來源影格互相矛盾的參考素材。若夾克、髮型或產品標籤各有兩種版本,模型會更難理解「保持不變」。
評估模型品質前,先確認設定。長寬比或音訊選項錯誤,可能讓原本良好的動作測試無法使用。
請確認:
目前官方 API 可直接請求 768P 或 2K 輸出,片長為 4~15 秒,並提供常用或自適應長寬比。符合條件的 768P 結果也可使用文件所述的 2K 再生成流程;但再生成只是選用管道,並非取得 2K 的唯一方式。H3 可生成原生立體聲音訊,第三方介面提供的控制項目可能較少。
動作、身分與構圖都通過檢查後,才進行畫質提升。DomoAI 的 影片放大(Video Upscaler) 可透過降噪與細節增強,將最終影片提升至 4K。
先完整播放一次影片,再檢查三個影格。中間影格往往能揭露首尾影格看不出的問題。
| 檢查項目 | 通過條件 | 警訊 |
|---|---|---|
| 身分 | 主體仍可清楚辨識 | 臉部、產品形狀或服裝改變 |
| 動作 | 動作發展自然 | 主體僵住或突然加速 |
| 相機 | 相機運動符合提示詞 | 出現未要求的縮放、晃動或角度變化 |
| 背景 | 空間結構保持連貫 | 牆面、招牌或物件融化變形 |
| 文字與標誌 | 細節仍清楚可讀 | 字母改變或漂移 |
| 音訊 | 聲音符合畫面事件 | 對話、效果音或環境音與畫面無關 |
| 結尾 | 最後一影格可接續後續剪輯 | 鏡頭在動作中途停止,或錯過預定構圖 |
請同時以正常速度與逐影格方式檢查。影片整體看似流暢,標誌仍可能在其中幾個影格發生變化。
把「dynamic」等模糊形容換成看得見的動作,明確寫出身體部位、方向、距離與速度。
不要只寫 make the scene more dynamic,改寫成 the subject takes two steps forward while the camera slowly tracks backward.
刪除互相競爭的相機指令。只選一種相機運動,再加上限制條件,例如 stable horizon, no handheld shake.
減少動作、加強身分限制,並使用更清楚的參考素材。處理產品時,請固定標誌位置、標籤文字、比例與材質。
要求局部動態,不要讓整個場景一起變化。固定建築與版面,只加入風、反射、煙霧或其他範圍有限的效果。
把音訊當成獨立的檢查層。先確認目前 H3 模式提供哪些控制項目;需要精準音樂、旁白或品牌音效時,再到外部編輯器替換或混音。
若目前模式支援,請加入最後一影格。確保轉換符合物理邏輯,並簡化兩個端點之間的動作。
同一張來源圖片用於產品頁、社群動態或電影序列時,需要不同的動作設計。
保護產品輪廓、標籤、材質與標誌。相機運動要慢,反射變化要有限,並以清楚可讀的產品定鏡收尾,不要停在動作途中。
一開始就呈現明確動作。主體在手機畫面上要足夠大,構圖採用 9:16,並在生成前為字幕保留安全範圍。
用動作傳達情緒或資訊。相較於複雜的全身動作,一次眼神轉移、呼吸或小幅相機運動通常更能維持身分。選擇最後一影格前,也要先規劃下一個剪接點。
把開場吸引點、產品證明、主持人與收尾鏡頭分開,各自生成短片段。這樣較容易替換不理想的片段,也能逐段檢查品牌細節。
大量生成前,先針對最終發布平台測試一個代表性鏡頭。橫向畫面穩定,不代表裁成較窄的直式畫面後,手部、文字與產品邊緣仍能保持完整。
MiniMax H3 即將在 DomoAI 上線。正式推出後,我們會立即分享消息,敬請期待。目前你可以使用 Omni Reference 中的 Seedance 2.5 。
上傳或選用乾淨的來源圖片,選擇目前的圖片轉影片任務,再撰寫以動作為主的提示詞。繼續生成前,請檢查身分、動作、相機、背景、音訊與結尾。
MiniMax 目前的影片文件列有首尾影格流程,但任務名稱、輸入規則與使用管道可能因介面而異。
使用主體清楚、邊緣清晰、人體結構合理、文字穩定、照明乾淨且留有動作空間的圖片。來源圖片的長寬比也要符合最終發布平台。
參考素材與固定提示詞有助於提高連續性,但無法保證完全一致。請先測試短片段,逐影格檢查臉部、服裝、形狀、文字與顏色。
可以。MiniMax 官方發布頁面與儲存庫均記載原生立體聲音訊,官方儲存庫標示為 32 kHz 立體聲輸出。請確認你所用管道實際提供哪些音訊控制項目。
目前還不行。MiniMax H3 即將在 DomoAI 上線。
穩定的圖片轉影片結果,需要適合動態化的來源圖片、描述動作的提示詞,以及明確的檢查方法。
先準備一張品質良好的靜態圖片,執行一次受控測試,再檢查開頭、中段與結尾,確認後才擴展場景。
最近的文章