
Table des matières

Essayez DomoAI, le meilleur générateur d'animation IA
Transformez n'importe quel texte, image ou vidéo en vidéos animées, réalistes ou artistiques. Plus de 30 styles uniques disponibles.
La génération vidéo par référence dans MiniMax H3 fonctionne mieux lorsque chaque source a un rôle précis. Utilisez une image pour l’apparence ou la composition, une vidéo pour le mouvement ou la caméra, et un fichier audio pour un signal sonore. Indiquez ensuite ce que H3 doit conserver, transférer, modifier ou traiter comme une référence générale.
Un même fichier peut fournir plusieurs sujets ou attributs. La règle « un rôle par source » fixe une responsabilité principale pour chaque fichier. Il s’agit d’une méthode de planification, pas d’une limite technique à un seul fichier.
Reference-to-Video, ou Ref2VA, associe du texte à des images, vidéos ou fichiers audio de référence pour guider un nouveau clip audiovisuel. Chaque source peut définir l’identité, l’apparence, le style, le mouvement, la caméra, le timing, la voix, les effets sonores ou la musique.
H3 ne traite pas chaque fichier comme une image vidéo. Une image fixe peut définir l’apparence, une vidéo peut guider la caméra et un fichier audio peut orienter le timbre.
Le guide officiel de MiniMax sur les prompts avec références complètes formalise ces relations à l’aide d’étiquettes, de marqueurs de conservation et d’un plan en six sections.
Ce format décrit les relations visées, sans garantir une identité exacte, un comportement physique précis, la synchronisation labiale, le timing, le texte ni une reproduction pixel par pixel.
Choisissez FL2VA lorsqu’une image fournie doit servir de première image, de dernière image ou des deux. Choisissez Ref2VA lorsque les sources doivent guider des attributs ou un comportement sans constituer des points de départ ou d’arrivée fixes.
| Besoin | Mode H3 recommandé | Pourquoi |
|---|---|---|
| Commencer à partir d’une image initiale | Checkpoint FL2VA en mode I2VA de première image | L’image fournie fixe l’état initial |
| Atteindre une image finale fournie | Checkpoint FL2VA en mode L2VA | Le prompt décrit la transition vers l’état final |
| Contraindre la première et la dernière image | Checkpoint FL2VA en mode première et dernière image | Les deux points de terminaison sont explicites |
| Utiliser l'identité, le style, le mouvement, la caméra ou le son provenant de plusieurs sources | Ref2VA | Chaque source peut recevoir un rôle de référence différent |
| Mélanger des rôles API de première/dernière image avec des rôles de référence dans une même demande | Non pris en charge dans une seule demande API | L'API officielle traite ces familles de rôles comme s'excluant mutuellement |
La documentation de l’API Video Generation V2 sépare les rôles de première/dernière image des rôles de médias de référence. Une même demande API ne peut pas combiner ces familles.
Chaque référence ajoute une autre relation que H3 doit interpréter.
Utilisez ce filtre à cinq vérifications avant le téléchargement :
Un packshot propre guide généralement mieux la géométrie qu’un collage chargé. Un clip de mouvement stable communique mieux l’intention de la caméra qu’un montage rapide.
Planifiez le plan avant de rassembler les références. Ce guide du storyboard IA aide à distinguer les décisions de composition, d’action et de caméra avant l’animation.
Le référentiel H3 actuel de MiniMax et la documentation du modèle répertorient ces limites Ref2VA locales :
L'API hébergée nécessite un prompt de texte non vide dans chaque demande. Sa limite actuelle de corps de demande est de 64 Mo.
Les images de référence API peuvent utiliser JPG, JPEG, PNG, WEBP, HEIC ou HEIF. La vidéo de référence accepte MP4 ou MOV, tandis que l'audio de référence accepte WAV ou MP3.
Les exigences de téléchargement de l'API peuvent changer, alors consultez la documentation actuelle de l’API Video Generation V2 avant de soumettre une demande.
MiniMax répertorie ComfyUI comme une option d'inférence locale. Les règles de saisie locales et les règles de demande d'API hébergée peuvent différer.
Créez une fiche des rôles de référence avant de rédiger le prompt. Attribuez à chaque fichier un rôle principal et, si nécessaire, un rôle secondaire.
| Source ou étiquette | Rôles principaux adaptés | Ce que cela ne garantit pas |
|---|---|---|
<Subject N> | Personne, objet, environnement, action, pose, effet ou style réutilisables extraits des sources | Verrouillage parfait de l’identité ou équivalence avec un fichier importé séparément |
<Picture N> | Image précise, composition, repère de storyboard, disposition spatiale ou ancre d'éclairage | Mouvement complet, structure temporelle ou rétention parfaite de la géométrie |
<Video N> | Montage source, suite, modèle de mouvement, chemin de caméra, coupes, rythme ou structure temporelle | Remplacement garanti, physique exacte ou copie pixel par pixel |
<Audio N> | Timbre de voix, rythme, signal de dialogue, effet sonore, traits musicaux, continuité ou réutilisation audio directe | Synchronisation labiale garantie ou entrée Ref2VA locale uniquement audio |
Voici le format de la feuille de travail :
| ID du fichier | Type | Droits obtenus ? | Rôle principal | Rôle secondaire | Conserver, transférer ou modifier | Plage de plans | Vérification de conflit ou d’acceptation |
|---|---|---|---|---|---|---|---|
| Picture 1 | Image | Oui | Aspect et étiquette de la bouteille | Couleur du matériau | Conserver la géométrie et le capuchon noir mat | Tous les plans | L'étiquette reste orientée vers l'avant |
| Picture 2 | Image | Oui | Environnement de serre | Palette de l'aube | Transférer uniquement le décor, pas ses accessoires | Tous les plans | Aucun deuxième produit n'apparaît |
| Video 1 | Vidéo | Oui | Arc de caméra dans le sens des aiguilles d'une montre | Rythme lent | Transférer le chemin de la caméra uniquement | Plan 1 | La bouteille ne reprend pas la forme de la source |
| Audio 1 | Audio | Oui | Texture de carillon en verre | Timing du son final | Référencer la texture sans copier le signal | Plan 2 | Un carillon net après le clic du capuchon |
Les critères d’acceptation permettent de vérifier chaque rôle séparément.
Pour les projets de produit, le guide de cohérence produit-vidéo ajoute des vérifications de géométrie et d’étiquettes.
Cette consigne ne définit aucune priorité :
Use the silver cap from Picture 1 and the black cap from Picture 2. Keep both exact.
Cette version attribue la responsabilité :
Picture 1 controls the bottle geometry, amber glass, matte-black cap, and label. Picture 2 controls only the greenhouse environment and dawn lighting; ignore the container shown in Picture 2.
Lorsqu'une performance de référence compte plus que son interprète, indiquez explicitement cette limite : Video 1 contrôle uniquement le mouvement et la caméra ; ignorez son interprète et son cadre.
Gardez les numéros d’étiquette stables dans les six sections.
<Subject N> désigne un élément visible réutilisable ou modifiable, tel qu'une personne, un produit, un environnement, une action, une pose, une interface ou un style.
<Subject 1> is the square amber-glass perfume bottle whose geometry, matte-black cap, and cream "NORTHLINE" label come from <Picture 1>.
Utilisez <Picture N> seul lorsque l’image sert de cadre concret ou de repère de composition.
<Picture 3> is the first-frame composition anchor for [Shot 1], defining the bottle position, plinth angle, and empty space on the right.
Si une image définit uniquement un Subject, citez-la dans la définition de ce Subject.
Utilisez <Video N> pour le montage de la source, la suite, la caméra, les coupes, le rythme ou la structure temporelle. Les personnes et objets extraits ont toujours besoin d’étiquettes Subject.
Utilisez <Audio N> pour une réutilisation directe ou une référence à la voix, au timing, au rythme, aux effets ou aux caractéristiques musicales. Les numéros Audio et Vidéo restent indépendants.
Le guide de référence complet de MiniMax utilise six sections dans cet ordre :
subject_definitionssummaryretention_analysisdetailed_descriptionoverall_soundscapenon_diegetic_musicL'API hébergée nécessite du texte, mais elle n'exige pas que chaque utilisateur rédige manuellement cette réécriture complète. H3-Context-IR peut traiter une entrée multimodale de forme libre. Utilisez les six sections comme langage de planification précis, et non comme schéma API brut obligatoire.
L'exemple original ci-dessous applique le format documenté de MiniMax à une photo de produit fictif.
Exemple de fiche d’exécution : Ref2VA · 8 secondes · 16:9 · trois images · une vidéo · une référence audio.
subject_definitions:
<Subject 1> is the square amber-glass perfume bottle whose geometry, matte-black cap, and cream "NORTHLINE" label come from <Picture 1>.
<Subject 2> is the greenhouse environment from <Picture 2>, with wet black-basalt surfaces, tall fern leaves, glass roof panels, and cold blue dawn light.
<Picture 3> is the first-frame composition anchor for [Shot 1], defining the bottle position, plinth angle, and empty space on the right.
<Video 1> provides the slow clockwise camera arc and measured pacing for [Shot 1], without providing product appearance.
<Audio 1> is the sound-texture reference for one clear glass chime heard after the cap click in [Shot 2].
summary:
[keyframe completion + reference generation + audio reference] The target video presents <Subject 1> inside <Subject 2>. It begins from the composition in <Picture 3>, follows the camera path from <Video 1>, and uses <Audio 1> only as a sound-texture reference for the final chime.
retention_analysis:
<Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved - the square amber-glass body, matte-black cap, cream "NORTHLINE" label, and front-facing product identity are retained.
<Subject 2> (appears in [Shot 1], [Shot 2]): fully_preserved - the wet basalt, fern leaves, glass roof, and cold blue dawn lighting are retained.
<Picture 3> ([Shot 1] first frame): fully_preserved - the opening bottle position, plinth angle, and right-side negative space are retained.
<Video 1> (camera path and pacing): partially_preserved - its slow clockwise arc and measured speed guide [Shot 1], while its source subjects and setting are excluded.
<Audio 1>: reference - its clean glass-chime texture guides one newly generated accent without copying the original signal.
detailed_description:
The target video uses a live-action cinematic product-film style with restrained movement and cool dawn lighting.
[Shot 1] The shot begins from <Picture 3>. <Subject 1>, the square amber-glass perfume bottle with a matte-black cap and cream "NORTHLINE" label, stands on the wet basalt plinth inside <Subject 2>. The camera follows the slow clockwise arc and measured pacing referenced from <Video 1>. Cold blue light enters from the right through the greenhouse roof. Water beads slide down the amber glass. Fern leaves move slightly behind the product. The bottle stays fixed, front-facing, and unchanged while the camera completes the arc. No second bottle, subtitle, or watermark appears.
[Shot 2] At 00:05.000, the camera cuts to a static close-up of <Subject 1>. A clean hand enters from the upper right, presses the matte-black cap down once, and releases it. The cap makes a dry click. A single newly generated glass chime follows, using the clear texture referenced from <Audio 1> without copying its signal. A narrow amber reflection crosses the cream "NORTHLINE" label from left to right. The hand exits. The bottle remains centered and readable through the final frame.
overall_soundscape:
Light rain taps on the glass roof throughout the video. Fern leaves brush softly in the background, while water drops strike the basalt and the cap produces one dry mechanical click.
non_diegetic_music:
N/A
Le plan indique ce que chaque source contrôle et exclut.
Attribuez des rôles par plan, car une référence peut n'avoir d'importance que pour une partie du clip.
Utilisez cet ordre pour chaque prise de vue :
Le premier plan ne comporte pas d’horodatage. Pour les plans suivants, utilisez [Shot N] At MM:SS.mmm, ... avec des temps de coupe croissants. Si deux vidéos guident le mouvement, attribuez le mouvement du corps à l’une et la caméra à l’autre.
Choisissez le marqueur audio qui correspond à la relation de signal souhaitée.
| Marqueur | Signification en langage simple |
|---|---|
fully_copy | Réutilisez l’intégralité de l’audio source comme piste audio finale complète |
partially_copy | Copiez une partie de la timeline ou certains calques, puis modifiez le reste |
reference | Générez un nouvel audio guidé par le timbre, le rythme, le style, les mots, la pulsation ou la texture sonore |
weak_reference | Ne conserver que la catégorie générale ou la similarité atmosphérique |
Lorsque l’audio guide un locuteur cible, associez-le au même identifiant stable (Sx) que dans detailed_description. Si seul le timbre est transféré, ne copiez pas le dialogue source dans la sortie.
N’oubliez pas la restriction locale : l'audio ne peut pas être la seule référence média pour H3-Base-Ref2VA. Incluez une image ou une vidéo.
Classez chaque rôle prévu comme conservé, partiellement conservé, absent ou en conflit.
| Critère | Question |
|---|---|
| Identité | La personne ou l’objet visé reste-t-il reconnaissable à travers ses prises de vue ? |
| Apparence | Les couleurs, vêtements, matériaux, étiquettes ou styles nommés sont-ils présents ? |
| Géométrie | Le produit a-t-il conservé sa forme et ses relations entre les pièces ? |
| Mouvement | L’action demandée suit-elle le chemin et le rythme prévus ? |
| Caméra | La caméra a-t-elle utilisé la direction demandée sans hériter du contenu source indésirable ? |
| Timing | Chaque référence a-t-elle commencé et cessé d’agir dans la plage de plans prévue ? |
| Son | L'audio a-t-il été copié, référencé ou nouvellement généré comme prévu ? |
| Conflits | Deux références sont-elles en compétition pour le même attribut ? |
Révisez une relation à la fois. Si seule la caméra pose problème, précisez que Video 1 contrôle uniquement la caméra et excluez le produit de la source.
Vérifiez les entrées officielles et votre plan de rôles avant d’attribuer le problème au modèle.
Le cache, la quantification, le nombre de pas, les nœuds et la VRAM peuvent affecter une configuration locale spécifique. Leurs effets varient selon la configuration.
H3-Base en local produit une vidéo 768p avec un audio stéréo natif. La version publique comprend des checkpoints FL2VA et Ref2VA distincts.
Le système complet comprend également H3-Context-IR et H3-Regenerate-2K hébergés. Regenerate-2K utilise le résultat 768p ainsi que le contexte d'origine pour régénérer jusqu'à 2K.
Regenerate-2K n'est pas un upscaler conventionnel, et il ne figure pas dans la publication actuelle des poids ouverts. Le téléchargement de Ref2VA seul ne fournit donc pas le flux de travail 2K local complet.
FL2VA fixe la première image, la dernière ou les deux. Ref2VA attribue des rôles d’identité, de style, de mouvement, de caméra, de temps ou de son aux images, vidéos et fichiers audio de référence.
La fiche du modèle indique jusqu’à 9 images, 3 vidéos et 3 fichiers audio, avec un maximum de 12 fichiers mixtes. La durée totale des vidéos et celle des fichiers audio ne peuvent chacune dépasser 15 secondes.
Pas dans le flux Ref2VA local documenté. L’audio de référence doit accompagner une image ou une vidéo. L’API hébergée applique des règles de demande distinctes.
Non. L’API exige du texte, mais n’impose pas de soumettre manuellement les six sections. Cette structure est une méthode de planification précise.
La vidéo peut guider un schéma de mouvement, une trajectoire de caméra, un rythme ou une structure temporelle. Considérez-la comme un guide, pas comme la garantie d’une reproduction exacte.
H3-Base génère du 768p en local. La chaîne officielle vers le 2K dépend de l’étape hébergée Regenerate-2K, absente de la publication actuelle des poids ouverts.
Avant votre prochaine demande Ref2VA, créez la fiche des rôles de référence. Attribuez un rôle principal à chaque source, puis évaluez le premier résultat selon ce rôle.
MiniMax H3 arrivera bientôt dans DomoAI. Nous vous informerons dès qu’il y sera disponible.
Articles récents
© 2026 DOMOAI PET. LTD.
Accueil AI