
Table des matières

Essayez DomoAI, le meilleur générateur d'animation IA
Transformez n'importe quel texte, image ou vidéo en vidéos animées, réalistes ou artistiques. Plus de 30 styles uniques disponibles.
Un bon prompt MiniMax H3 commence par le choix du mode adapté. Il sépare ensuite la chronologie visuelle, les dialogues, les sons physiques et la musique réservée au public. Ce guide propose des modèles originaux prêts à copier pour T2VA, I2VA, FL2VA, L2VA et l’audio natif. Chaque modèle respecte le format officiel de MiniMax.
Une structure correcte donne à H3 des instructions plus claires, mais elle ne peut pas garantir une correspondance exacte des coupes, des voix, du texte, du mouvement ou des images.
Les prompts ci-dessous s’appuient sur des exemples fournis dans la documentation officielle de MiniMax.
Commencez par examiner les ressources visuelles dont vous disposez. Ne choisissez pas un mode uniquement parce que son acronyme paraît plus avancé.
| Mode | Entrée fournie | Rôle de la première instruction | Cas d’usage idéal |
|---|---|---|---|
| T2VA | Aucun | Établir la scène, les sujets, l'action, les plans et le plan audio complet | Créer une nouvelle idée audiovisuelle à partir de texte |
| I2VA | Une première image | Référencer entièrement l’image d’ouverture, puis décrire la suite | Animer une composition d’ouverture préparée |
| FL2VA | Première et dernière images | Aligner les deux images et décrire la transition visible entre elles | Contrôler l'ouverture et la fin d'une transition |
| L2VA | Une dernière image | Construire une séquence antérieure plausible qui aboutit à l’image finale fournie | Concevoir une révélation ou une transformation de fin en premier |
| Ref2VA | Images et/ou vidéo de référence, avec audio de référence en option ; l'audio ne peut pas être la seule entrée de référence | Attribuer un rôle à chaque ressource avec le format de référence complet | Guider l’identité, le style, le mouvement, la caméra ou le son à partir de plusieurs sources |
MiniMax documente ces quatre modes de base dans son guide officiel des prompts H3-Base. Ref2VA utilise un format de planification distinct en six sections et relève donc d’un workflow avancé séparé.
Considérez le prompt de base comme trois couches : la chronologie, les sons physiques et la musique réservée au public.
integrated_multimodal_description:
[Shot 1] Describe the subjects, setting, visible action, camera, dialogue, and any sound tied to this moment.
[Shot 2] At 00:03.000, describe the next visible and audible event.
overall_soundscape:
Describe ambience, physical sound effects, and non-verbal human sounds across the clip.
non_diegetic_music:
Describe the audience-only score, or write N/A when no score is wanted.
integrated_multimodal_description définit l’ordre de lecture. Placez-y les plans, les actions, les dialogues, le chant, le texte visible et les sons synchronisés.
overall_soundscape couvre l’ambiance, le vent, la circulation, les pas, les impacts, les frottements de tissu, la respiration et les autres sons physiques. N’y répétez pas l’intégralité des dialogues.
non_diegetic_music couvre la musique que seul le public entend. Si une radio ou un artiste crée de la musique dans la scène, conservez plutôt cet événement dans la chronologie.
Utilisez ce flux de travail en sept parties :
T2VA n'a pas de ligne d'alignement d'image. Commencez par les trois champs et établissez tout à partir du texte.
L’exemple ci-dessous crée une présentation de produit de huit secondes. La description verrouillée du produit reste identique d’un plan à l’autre : « un flacon de parfum carré en verre ambré, avec un bouchon noir mat et une étiquette crème portant le texte “NORTHLINE” ».
Avant de tester, répertoriez les détails du produit qui ne peuvent pas dériver. Le guide de cohérence produit-vidéo montre comment transformer ces détails en un contrôle d'acceptation.
Paramètres du test : T2VA · 8 secondes · 16:9 · aucune image fournie.
integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. A square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" stands on a wet black-basalt plinth inside a greenhouse before sunrise. Cold blue window light reaches the bottle from camera right. The camera makes a slow, small-amplitude push toward the plinth. Water beads slide down the glass while fern leaves move gently behind it. [Shot 2] At 00:04.000, the camera cuts to a close-up of the same square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE". A narrow amber light sweeps from left to right across the bottle. The label stays front-facing and readable. One water bead reaches the base as a quiet off-screen woman (S1) says: <d>[English] Find your north.</d> The shot holds steady through the final frame. No extra bottle, label, subtitle, or watermark appears.
overall_soundscape: Light greenhouse rain taps on the glass roof. Leaves rustle softly while water drops strike the basalt surface. A low room tone continues beneath the voice.
non_diegetic_music: Three isolated felt-piano strikes sound during the first half. A bowed-glass drone rises twice, then stops two seconds before the end.
L'étiquette, la voix, le balayage de lumière et la goutte d'eau synchronisée se trouvent dans la chronologie. La pluie et le mouvement des feuilles s’intègrent dans le paysage sonore.
I2VA traite l’image fournie comme la première image réelle à 0,00 seconde. Utilisez la première ligne imposée par MiniMax, puis décrivez la suite à partir de ce que l’image établit déjà.
Ne recréez pas la première image en prose. Préservez le produit visible, la composition, l’éclairage, les couleurs et les relations spatiales avant d’ajouter du mouvement.
Paramètres du test : I2VA · 8 secondes · image source 16:9 · Picture 1 correspond au plan d’ouverture du produit.
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. The square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" remains in the position, scale, lighting, and greenhouse composition established by <Picture 1>. The camera arcs clockwise with small amplitude at slow speed. Water beads move down the glass while the background fern leaves shift in a light draft. A narrow amber reflection begins at the bottle's left edge and travels across its front face. The label remains front-facing and readable. At the end, the camera stops and holds the original product as the brightest object. No extra bottle, label, subtitle, or watermark appears.
overall_soundscape: Soft rain taps the greenhouse roof while leaves brush against one another. Water drops strike the basalt plinth at irregular intervals.
non_diegetic_music: A muted handpan sounds once every two seconds. One airy synthesizer tone enters halfway and recedes before the final frame.
Ce prompt ne décrit que les changements qui peuvent découler de l’image. Il évite ainsi de remplacer le produit ou la scène pendant le mouvement de caméra.
FL2VA ancre les deux extrémités. Le prompt doit expliquer la transition visible entre Picture 1 et Picture 2.
Utilisez une seule prise lorsque vous souhaitez une interpolation continue. N'ajoutez des coupes que lorsque le plan créatif l'exige vraiment.
Paramètres du test : FL2VA · 8 secondes · images sources 16:9 correspondantes · Picture 1 à 0,00 s · Picture 2 à 8,00 s.
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 8.00-second mark of the target video.
integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. At the opening instant, Picture 1 determines the square amber-glass perfume bottle's location, size, and framing. It has a matte-black cap and a cream label reading "NORTHLINE". The camera trucks right with small amplitude at slow speed. A thin stream of water crosses the basalt plinth from left to right. The greenhouse light shifts gradually from cold blue dawn toward Picture 2's warm amber direction. Fern shadows travel across the background, then settle. The bottle does not rotate, and its label remains front-facing. By the last frame, the camera, water, reflections, shadows, and lighting match Picture 2's spacing, viewing angle, and composition. No extra bottle, label, subtitle, or watermark appears.
overall_soundscape: Rain decreases gradually as water runs across the stone. The final drops become farther apart before the scene settles into quiet greenhouse ambience.
non_diegetic_music: N/A
Un prompt FL2VA efficace décrit les changements intermédiaires : déplacement de la caméra, position de l’eau, évolution de la lumière et mouvement des ombres.
L2VA fait de l'image 1 la fin, pas l'ouverture. Choisissez un état antérieur plausible qui peut atteindre ce cadre dans le temps disponible.
La ligne officielle utilise le numéro du dernier plan et une durée effective avec exactement deux décimales. Un prompt d’un seul plan de huit secondes se termine donc à 8.00-second et indique Shot 1.
Paramètres du test : L2VA · 8 secondes · image finale 16:9 fournie · Picture 1 correspond à la composition finale du produit.
How the reference pictures align with the target video — <Picture 1> (from [Shot 1]) aligns with the 8.00-second mark of the target video.
integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. An empty wet black-basalt plinth fills the foreground inside a dark greenhouse before sunrise. The camera pulls out with small amplitude at slow speed. From the left, a square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" slides smoothly onto the plinth and slows as it reaches center. Cold blue light from the right changes gradually to a narrow amber beam from the left. Water beads become visible on the bottle. During the final two seconds, every moving element comes to rest. The object placement, scale, camera view, reflections, label direction, fern shadows, and illumination now match <Picture 1>. No extra bottle, label, subtitle, or watermark appears.
overall_soundscape: Rain taps the greenhouse roof while glass slides softly over wet stone. The sliding sound slows and stops as one final drop strikes the plinth.
non_diegetic_music: Four muted glass harmonics sound at even intervals. The fourth ends as the bottle stops moving.
La planification à rebours fonctionne mieux lorsque l’état d’ouverture ne nécessite que quelques changements.
Le premier plan n’a pas d’horodatage. Chaque plan suivant commence à un temps de coupe strictement supérieur au précédent et compris dans la durée cible.
MiniMax documente le format de libellé suivant ; les points de suspension servent ici de texte de remplacement :
[Shot 1] Live-action, cinematic, a medium-wide shot establishes...
[Shot 2] At 00:03.500, the camera cuts to...
[Shot 3] At 00:06.250, the shot switches to...
N’utilisez pas d’horodatage pour décrire une action continue au sein d’un même plan. En l’absence de coupe, écrivez plutôt « à mi-parcours du plan ».
La direction de la caméra nécessite d'abord un type de mouvement. Ajoutez de l'amplitude et de la vitesse uniquement lorsqu'elles contribuent à définir le résultat.
| Direction faible | Une direction plus claire |
|---|---|
| Caméra cinématographique | La caméra effectue un lent mouvement avant de faible amplitude |
| Mouvement dynamique | La caméra effectue un travelling gauche rapide de grande amplitude |
| Focus sur l'étiquette | La caméra réalise un gros plan statique pendant que la lumière traverse l'étiquette |
| Entourez le produit | La caméra effectue un arc dans le sens des aiguilles d'une montre avec une petite amplitude à vitesse lente |
Planifiez les coupes avant d’écrire la syntaxe du prompt. Le guide du storyboard IA explique comment définir le rôle et la continuité des plans avant l’animation.
H3 génère des vidéos avec audio stéréo natif : les indications audio doivent donc figurer dans le prompt initial. Distinguez clairement les quatre rôles sonores suivants.
| Rôle sonore | Où l’indiquer | Exemple |
|---|---|---|
| Dialogue ou chant | integrated_multimodal_description | (S1) says: <d>[English] Find your north.</d> |
| Événement synchronisé | Plan actuel dans la timeline | Le capuchon se ferme lorsque la main le relâche |
| Ambiance et son physique | overall_soundscape | Pluie, pas, tissu, impacts, respiration |
| Musique réservée au public | non_diegetic_music | Instrumentation, tempo, rythme et changement de volume |
Attribuez (S1), (S2), puis les identifiants suivants dans l’ordre de première apparition des voix. Conservez le même identifiant pour une même voix dans tous les plans.
Placez uniquement la balise de langue et les paroles exactes dans <d>. Laissez la description du locuteur, son action, son interprétation et son identifiant en dehors de la balise.
The calm off-screen woman (S1) says: <d>[English] Find your north.</d>
The shopkeeper with a low, measured voice (S2) replies: <d>[English] It was here all along.</d>
Pour une voix off, utilisez la formulation explicite de MiniMax et gardez la bouche du personnage à l’écran fermée :
The woman (S1) says in an off-screen voiceover: <d>[English] I kept the first bottle.</d> while her lips remain completely closed.
Écrivez N/A dans non_diegetic_music si vous souhaitez conserver l’ambiance et les effets sans ajouter de musique réservée au public. Utilisez overall_soundscape: N/A uniquement pour demander un silence total.
Le texte visible nécessite des guillemets doubles. Copiez-le exactement, y compris la ponctuation. Citer une étiquette peut améliorer la clarté des instructions, mais cela ne garantit pas un rendu parfait du texte.
Commencez par vérifier la structure avant de modifier les termes de style. Ne changez qu’une variable à la fois, puis comparez la sortie suivante avec les mêmes critères d’acceptation.
| Échec | Problème probable du prompt | Correction du format officiel |
|---|---|---|
| La mauvaise personne parle | Les identifiants ont changé ou un locuteur n'a jamais été établi | Attribuer des identifiants stables (S1) et (S2) à la première apparition de chaque voix, puis les réutiliser |
| Une musique de fond indésirable apparaît | Le champ de score était vague ou manquant | Écrire non_diegetic_music: N/A tout en conservant les sons physiques souhaités dans overall_soundscape |
| Un horodatage semble ignoré | L'horodatage marque une action, pas une coupure, ou se situe en dehors de la durée | Horodater uniquement les plans suivants et conserver des temps de coupe strictement croissants dans le clip |
| La vidéo se coupe au hasard | Les changements d'angle mineurs ont été écrits sous forme de plans séparés | Conserver un seul plan et décrire le mouvement de caméra, sauf si une coupe introduit une nouvelle information |
| FL2VA saute entre les points de terminaison | Le prompt répète deux descriptions statiques | Nommer les changements intermédiaires observables qui atteignent progressivement l’image finale |
| L2VA traite l’image comme une image d’ouverture | La ligne d'alignement de la dernière image ou la convergence finale est manquante | Placer l’instruction L2VA en premier et n’atteindre l’image qu’à la fin |
| Le texte visible dérive | Le texte a été paraphrasé ou laissé sans citation | Conserver le texte exact entre guillemets doubles droits, puis vérifier le résultat |
| Le dialogue se répète dans le paysage sonore | Les mots prononcés ont été copiés dans plusieurs champs | Conserver l’intégralité du dialogue uniquement dans <d>, au sein de la chronologie visuelle |
Ces corrections améliorent la clarté des instructions, sans garantir que chaque génération respectera tous les détails.
Si un prompt doit combiner identité, mouvement, caméra et voix provenant de plusieurs fichiers sources, cessez d’étendre ce format de base. Utilisez Ref2VA et le guide officiel de référence complet.
Copiez cette liste de contrôle dans vos notes de production :
[Shot 1] n'a pas d'horodatage ; les temps de coupure ultérieurs augmentent et restent dans la durée.(Sx).<d>.overall_soundscape.non_diegetic_music, ou ce champ indique N/A.La référence de l’API Video Generation V2 exige un prompt textuel non vide. Elle distingue également les rôles de première et dernière image de ceux des médias de référence ; ne mélangez donc pas ces familles de rôles dans une même requête API.
La meilleure structure de base commence par le bon mode et utilise trois champs : integrated_multimodal_description, overall_soundscape et non_diegetic_music. Ajoutez la ligne officielle d’alignement des images avant ces champs pour I2VA, FL2VA ou L2VA.
T2VA part du texte ; I2VA, d’une première image ; FL2VA relie la première image à la dernière ; et L2VA aboutit à une dernière image fournie. Chaque mode modifie la première instruction du prompt et la direction du plan visuel.
Attribuez des identifiants stables comme (S1), (S2), puis les suivants lors de la première apparition de chaque voix. Réutilisez chaque identifiant dans tous les plans et placez dans <d> uniquement la balise de langue et les paroles.
Décrivez les effets synchronisés dans le plan et l’ambiance générale dans overall_soundscape. Écrivez ensuite non_diegetic_music: N/A pour ne pas demander de musique non diégétique.
Un horodatage peut échouer s’il marque une action plutôt qu’une coupe, répète un instant antérieur ou sort de la durée du clip. Utilisez-le seulement à partir du Plan 2, avec des temps de coupe strictement croissants.
Pour un prompt direct H3-Base Ref2VA, utilisez le format en six sections : définition des sujets, résumé, conservation, déroulement détaillé, ambiance sonore et musique. L’API hébergée accepte un prompt de texte non vide avec des médias de référence ; il n’est donc pas obligatoire de rédiger manuellement les six sections.
Vous pouvez maintenant choisir le bon mode H3, écrire sa chronologie et séparer chaque couche audio. Enregistrez le modèle correspondant et exécutez la liste de contrôle qualité avant votre prochaine génération.
MiniMax H3 sera bientôt disponible dans DomoAI. Nous vous informerons dès qu’il pourra y être utilisé.
Articles récents
© 2026 DOMOAI PET. LTD.
Accueil AI