內容表
MiniMax H3 的角色一致性要從生成影片前開始準備。建立乾淨的參考素材組、固定角色描述,並且每次只改變一項鏡頭變數。這種做法有助於減少角色在不同鏡頭中的臉部、服裝與風格漂移。
角色一致性是指觀眾在每個鏡頭中都能認出同一個主體。只有髮型相似,還不符合這項標準。
一致的角色應維持相同的核心身分:
相機角度、表情、姿勢與照明可以改變,但角色的辨識特徵不應改變。
MiniMax H3 接受文字、圖片、影片與音訊輸入。官方資料說明的 Reference Generation 流程以參考圖片與影片為主,也可加入與視覺媒體搭配的音訊參考。
H3-Context-IR 的用途不同:它會解讀多模態輸入並回傳增強後的提示詞,不會生成影片。參考素材有助於維持連續性,但 MiniMax 並未保證每個鏡頭中的身分都能完全一致。
單張肖像會留下許多未定義的細節。它只呈現一個角度、一種表情與部分服裝,模型必須自行推測畫面以外的內容。
生成連續鏡頭前,先準備一組精簡的參考素材:
每張圖片都要使用相同設計。若參考素材中的頭髮長度或夾克細節互相衝突,只會增加歧義,無法提高控制力。
若參考素材組需要修正,可使用 多模型圖片生成器與編輯器 。其中包含 GPT Image 2、Nano Banana 2 與 Nano Banana Pro;Nano Banana Pro 每次最多可接受 9 張參考圖片,適合需要多張角色參考或風格參考的工作。
你也可以使用 DomoAI 文字轉圖片建立第一張角色設定表。若需要動畫卡片風格素材, Anime Card Maker 也可作為起點。
把每個鏡頭都必須保留的細節,整理成一段可重複使用的內容:
Character name:
Face:
Hair:
Eyes:
Outfit:
Body silhouette:
Color palette:
Signature prop:
Visual style:
Do not change:
Allowed changes per shot:
每個欄位都要能從畫面上直接確認。「獨特的英雄」幾乎沒有提供具體指引;「藍綠色短髮配一束金色挑染、琥珀色眼睛、黑色短版外套配金色滾邊、象牙白高腰長褲與新月形墜飾」則定義了肉眼可見的限制。
建立一段身分描述,原封不動地貼到每個鏡頭提示詞。不要為了變化而重寫;即使只是微小的措辭差異,也可能改變模型關注的特徵。
Keep the same character: an adult anime singer with a teal bob and one thin gold streak, amber eyes, a black cropped jacket with gold trim, ivory high-waisted pants, teal ankle boots, a crescent pendant, slim silhouette, soft cel-shaded anime style, and the same face proportions in every shot.
把這段描述放在會改變的動作之前,並在整個序列中維持相同順序。
吉祥物或產品角色也可以使用相同結構:
Keep the same mascot: a small cobalt-blue fox with rounded ears, one white tail tip, a yellow messenger bag, three dark cheek marks, and the same flat graphic style in every shot.
這段文字只需要辨識角色,不必描述整個場景。
把每個鏡頭當成受控變化。身分描述保持固定,動作、相機或環境則分別寫在其他句子中。
Same character and outfit as the reference. Change only the action: she turns toward the camera, lifts the microphone, and takes one step forward under blue stage lights. Keep face shape, hair length, jacket, ivory high-waisted pants, crescent pendant, and color palette unchanged.
每個短片段只安排一項有意義的動作。若提示詞同時改變姿勢、服裝、地點、天氣、鏡頭、風格與情緒,模型必須處理太多互相競爭的決策。
三鏡頭序列可以這樣安排:
| 鏡頭 | 固定內容 | 改變內容 |
|---|---|---|
| 特寫 | 身分、服裝、風格、色盤 | 視線轉向相機 |
| 中景 | 身分、服裝、道具、照明風格 | 角色舉起麥克風 |
| 遠景 | 身分、服裝、舞台設計、色盤 | 角色走進聚光燈下 |
這種方法也有助於找出問題。若只改變相機後臉部就開始漂移,便能更容易鎖定新加入的變數。
文字描述的是一類特徵,參考素材則呈現精確的視覺關係。若單靠文字無法保留臉部、道具、服裝圖案或動作概念,請加入參考媒體。
鏡頭需要視覺參考,或需要把音訊參考與視覺媒體搭配時,可使用 MiniMax-H3 Reference Generation。目前流程最多接受 9 張圖片、3 段影片與 3 段音訊,混合參考輸入合計上限為 12 個檔案。每段影片或音訊須為 2~15 秒;參考影片與參考音訊各自的總長度上限均為 15 秒。MiniMax 的 H3 參考文件指出,音訊至少要搭配 1 張圖片或 1 段影片,不能作為唯一的參考輸入。
H3-Context-IR 可在生成前整理複雜的多模態輸入。它以非同步方式運作,回傳的是增強後的提示詞,不是影片。
依用途選擇參考素材:
不要預設加入所有圖片。只有彼此一致的參考素材才有幫助;請移除重複或互相矛盾的版本。
建立完整場景前,先做一組小型連續性測試。使用三種會暴露不同風險的鏡頭。
把三個片段並排檢查,不要只看其中最好看的影格。
使用以下漂移檢查表:
| 範圍 | 通過條件 | 常見漂移訊號 |
|---|---|---|
| 臉部 | 比例與年齡一致 | 下顎、眼睛或鼻子改變 |
| 頭髮 | 長度與輪廓一致 | 瀏海、髮量或顏色改變 |
| 服裝 | 剪裁與細節一致 | 袖子、標誌或配件消失 |
| 身體 | 身高與體型穩定 | 四肢或比例改變 |
| 色盤 | 主要顏色保持固定 | 夾克或眼睛顏色改變 |
| 風格 | 繪製語言一致 | 寫實程度或線條粗細改變 |
| 道具 | 形狀與位置仍清楚可辨 | 道具大小改變,或換到另一隻手 |
同一細節連續失敗兩次,就要改進參考素材或身分描述。隨機重試通常無法找出原因。
不同問題需要不同的修正方式。
| 問題 | 可能原因 | 下一次測試方式 |
|---|---|---|
| 不同角度的臉部不一致 | 側面參考不足,或臉部比例定義模糊 | 加入四分之三角度圖片,並固定臉型 |
| 頭髮變長或變色 | 頭髮描述缺少長度或輪廓 | 明確寫出長度、瀏海、質感與精確顏色 |
| 服裝的小細節消失 | 全身參考看不清細節 | 加入服裝局部圖片,並列出固定元素 |
| 角色變得更寫實 | 不同提示詞使用了不同的風格描述 | 固定使用同一段風格描述,不要替換同義詞 |
| 手部或道具變形 | 動作遮住了重要形狀 | 簡化手勢,並讓道具維持可見 |
| 背景影響服裝顏色 | 主體與背景明度太接近 | 提高來源圖片中的對比 |
若多個區域同時失敗,請降低鏡頭複雜度。先從穩定構圖開始,再加入相機或身體動作。
各種形式都能使用相同的身分管理方法,但不同角色與受眾有不同的失敗風險。
保護線條粗細、眼睛設計、頭髮輪廓、服裝層次與代表性配件。說話特寫與全身動作要分開測試;同一設計可能在某個景別穩定,換到另一個景別後就開始漂移。
固定臉部比例、外觀年齡、髮型、體型與反覆使用的服裝規則。相機與照明變化應保持合理;即使提示詞重複相同描述,極端的鏡頭變化仍可能改變臉部。
把品牌細節視為製作限制,記錄精確顏色、形狀、標記與道具位置。請對照已核准的風格指南檢查吉祥物,不要只憑記憶。
為每種預定照明條件與相機距離準備參考素材。夜間特寫與日間遠景會帶來不同的連續性風險;照明描述可以改變,身分描述則要保持固定。
不論角色類型為何,都應在正式製作前核准一小組鏡頭。這組素材會成為後續場景與審核人員的視覺基準。
MiniMax H3 即將在 DomoAI 上線。正式推出後,我們會立即分享消息,敬請期待。目前你可以使用 Omni Reference 中的 Seedance 2.5 。
若要把現有表演套用到新角色,可使用 角色轉影片 。此流程需要原始影片與目標角色圖片;Subject Only 模式可只保留主要主體。
對話或唱歌鏡頭則可使用 數位化身 。它接受圖片或影片搭配音訊,也支援多語言輸出。製作多段說話影片時,請固定使用同一張已核准肖像,以保護角色身分。
這些流程解決的問題不同。MiniMax H3 會依提示詞與參考素材生成新表演;DomoAI 角色轉影片會沿用既有動作;數位化身則為穩定的角色素材加入對話或歌聲。
使用乾淨的參考素材組、固定的身分描述,以及每次只改變一項鏡頭變數的提示詞。生成長序列前,請先測試短片段。
支援。MiniMax 官方文件列有使用圖片與影片的 Reference Generation,也可加入與視覺媒體搭配的音訊參考。H3-Context-IR 是選用的提示詞增強步驟,不是生成任務本身。
沒有適用於所有情況的最佳數量。先使用能清楚定義角色的最小一致素材組,只有缺少角度、服裝細節或動作要求時,才再加入參考。準備最終輸入時,也要遵守上方參考素材章節所列的技術限制。
加入更清楚的臉部參考、固定五官比例,並減少同時出現的相機或表情變化。請用相同起始設定比較多個短測試。
它可支援參考素材驅動的角色流程,但是否合適仍取決於特定風格與一致性目標。請分別測試臉部比例、線條風格、服裝細節與動作。
若現有表演必須控制角色動作,請使用角色轉影片;若要依提示詞與參考媒體建立全新鏡頭,則使用 H3。
穩定序列來自穩定輸入,不是更長的提示詞。把已核准的參考素材組、身分描述與 QC 表保存成製作基準;同一角色通過特寫、中景與遠景測試後,再擴大製作。
最近的文章