
Table of Content

Try DomoAI, the Best AI Animation Generator
Turn any text, image, or video into anime, realistic, or artistic videos. Over 30 unique styles available.
Gute Prompts für MiniMax H3 beginnen mit dem richtigen Modus. Anschließend trennen sie die visuelle Zeitleiste, Dialoge, physische Geräusche und nicht diegetische Musik. Dieser Leitfaden enthält eigenständige, kopierbare Vorlagen für T2VA, I2VA, FL2VA, L2VA und natives Audio. Jede Vorlage folgt dem offiziellen Format von MiniMax.
Eine korrekte Struktur gibt H3 klarere Anweisungen, kann jedoch keine exakten Schnitte, Stimmen, Texte, Bewegungen oder Frame-Übereinstimmungen garantieren.
Die folgenden Prompts basieren auf Beispielen in der offiziellen Dokumentation von MiniMax.
Beginne mit dem Bildmaterial, das du bereitstellen kannst. Wähle keinen Modus nur deshalb, weil sein Kürzel fortgeschrittener klingt.
| Modus | Bereitgestellte Eingabe | Erste Aufgabe des Prompts | Geeignet für |
|---|---|---|---|
| T2VA | Keine | Lege Szene, Motive, Handlung, Einstellungen und den vollständigen Audioplan fest | Erstelle aus Text eine neue audiovisuelle Idee |
| I2VA | Ein Startframe | Verankere das Eröffnungsbild vollständig und beschreibe anschließend den weiteren Ablauf | Animiere eine vorbereitete Eröffnungskomposition |
| FL2VA | Start- und Endframe | Richte beide Bilder aus und beschreibe einen erkennbaren Weg zwischen ihnen | Anfang und Ende eines Übergangs steuern |
| L2VA | Ein Endframe | Erstelle eine plausible frühere Sequenz, die im bereitgestellten Endframe ankommt | Eine vom Ende aus geplante Enthüllung oder Transformation entwerfen |
| Ref2VA | Referenzbilder und/oder -videos, optional mit Referenzaudio; Audio kann nicht der einzige Referenzeingang sein | Weise jedem Asset im vollständigen Referenzformat eine Rolle zu | Steuere Identität, Stil, Bewegung, Kamera oder Ton mit mehreren Quellen |
MiniMax dokumentiert diese vier Basismodi in seinem offiziellen H3-Base-Prompt-Leitfaden. Ref2VA nutzt ein anderes Planungsformat mit sechs Abschnitten und gehört deshalb in einen eigenen fortgeschrittenen Workflow.
Stell dir den Basis-Prompt als drei Ebenen vor: Zeitleiste, physische Geräusche und nicht diegetische Musik.
integrated_multimodal_description:
[Shot 1] Describe the subjects, setting, visible action, camera, dialogue, and any sound tied to this moment.
[Shot 2] At 00:03.000, describe the next visible and audible event.
overall_soundscape:
Describe ambience, physical sound effects, and non-verbal human sounds across the clip.
non_diegetic_music:
Describe the audience-only score, or write N/A when no score is wanted.
integrated_multimodal_description legt die Wiedergabereihenfolge fest. Schreibe Einstellungen, Handlung, Dialoge, Gesang, sichtbaren Text und synchronisierte Geräusche in dieses Feld.
overall_soundscape umfasst Raumklang, Wind, Verkehr, Schritte, Stöße, Stoffrascheln, Atmung und ähnliche physische Geräusche. Wiederhole hier nicht den vollständigen Dialog.
non_diegetic_music beschreibt Musik, die nur das Publikum hört. Kommt die Musik dagegen von einem Radio oder einer Person in der Szene, gehört dieses Ereignis in die Zeitleiste.
Verwende diesen siebenteiligen Workflow:
T2VA hat keine Bildausrichtungszeile. Beginne mit den drei Feldern und definiere alle Inhalte per Text.
Das folgende Beispiel zeigt eine achtsekündige Produktpräsentation. Die festgelegte Produktbeschreibung bleibt in allen Einstellungen identisch: „a square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE"“.
Liste vor dem Test die Produktdetails auf, die nicht abweichen dürfen. Der Leitfaden zur Konsistenz in Produktvideos zeigt, wie du daraus prüfbare Akzeptanzkriterien machst.
Ablaufdaten: T2VA · 8 Sekunden · 16:9 · kein bereitgestelltes Bild.
integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. A square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" stands on a wet black-basalt plinth inside a greenhouse before sunrise. Cold blue window light reaches the bottle from camera right. The camera makes a slow, small-amplitude push toward the plinth. Water beads slide down the glass while fern leaves move gently behind it. [Shot 2] At 00:04.000, the camera cuts to a close-up of the same square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE". A narrow amber light sweeps from left to right across the bottle. The label stays front-facing and readable. One water bead reaches the base as a quiet off-screen woman (S1) says: <d>[English] Find your north.</d> The shot holds steady through the final frame. No extra bottle, label, subtitle, or watermark appears.
overall_soundscape: Light greenhouse rain taps on the glass roof. Leaves rustle softly while water drops strike the basalt surface. A low room tone continues beneath the voice.
non_diegetic_music: Three isolated felt-piano strikes sound during the first half. A bowed-glass drone rises twice, then stops two seconds before the end.
Etikett, Stimme, Lichtbewegung und synchronisierter Wassertropfen stehen in der Zeitleiste. Regen und Blattbewegungen gehören in die Geräuschkulisse.
I2VA behandelt das bereitgestellte Bild als tatsächlichen Startframe bei 0.00 Sekunden. Verwende die feste erste Zeile von MiniMax und beschreibe anschließend nur, was sich aus dem bereits festgelegten Bild entwickelt.
Beschreibe den Startframe nicht neu. Behalte Produkt, Komposition, Beleuchtung, Farben und räumliche Beziehungen bei, bevor du Bewegung hinzufügst.
Ablaufdaten: I2VA · 8 Sekunden · 16:9-Quellbild · Picture 1 liefert die erste Produktaufnahme.
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. The square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" remains in the position, scale, lighting, and greenhouse composition established by <Picture 1>. The camera arcs clockwise with small amplitude at slow speed. Water beads move down the glass while the background fern leaves shift in a light draft. A narrow amber reflection begins at the bottle's left edge and travels across its front face. The label remains front-facing and readable. At the end, the camera stops and holds the original product as the brightest object. No extra bottle, label, subtitle, or watermark appears.
overall_soundscape: Soft rain taps the greenhouse roof while leaves brush against one another. Water drops strike the basalt plinth at irregular intervals.
non_diegetic_music: A muted handpan sounds once every two seconds. One airy synthesizer tone enters halfway and recedes before the final frame.
Der Prompt nennt nur Änderungen, die sich aus dem Bild entwickeln können. So bleiben Produkt und Szene erhalten, während sich die Kamera bewegt.
FL2VA verankert beide Enden. Der Prompt muss den sichtbaren Pfad zwischen Bild 1 und Bild 2 erläutern.
Verwende eine Aufnahme, wenn du eine kontinuierliche Interpolation wünschst. Füge Schnitte nur dann hinzu, wenn der kreative Plan sie wirklich erfordert.
Ablaufdaten: FL2VA · 8 Sekunden · passende 16:9-Quellbilder · Picture 1 bei 0.00 · Picture 2 bei 8.00.
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 8.00-second mark of the target video.
integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. At the opening instant, Picture 1 determines the square amber-glass perfume bottle's location, size, and framing. It has a matte-black cap and a cream label reading "NORTHLINE". The camera trucks right with small amplitude at slow speed. A thin stream of water crosses the basalt plinth from left to right. The greenhouse light shifts gradually from cold blue dawn toward Picture 2's warm amber direction. Fern shadows travel across the background, then settle. The bottle does not rotate, and its label remains front-facing. By the last frame, the camera, water, reflections, shadows, and lighting match Picture 2's spacing, viewing angle, and composition. No extra bottle, label, subtitle, or watermark appears.
overall_soundscape: Rain decreases gradually as water runs across the stone. The final drops become farther apart before the scene settles into quiet greenhouse ambience.
non_diegetic_music: N/A
Ein guter FL2VA-Prompt benennt die Zwischenbewegung: Kamerafahrt, Wasserposition, Lichtwechsel und Schattenbewegung.
L2VA macht Picture 1 zum Endframe, nicht zum Startframe. Wähle einen plausiblen früheren Zustand, der diesen Endframe innerhalb der verfügbaren Zeit erreichen kann.
Die offizielle Zeile verwendet die Nummer der letzten Einstellung und eine effektive Dauer mit genau zwei Dezimalstellen. Ein achtsekündiger Prompt mit nur einer Einstellung endet daher bei 8.00-second und verwendet Shot 1.
Ablaufdaten: L2VA · 8 Sekunden · bereitgestellter 16:9-Endframe · Picture 1 definiert die endgültige Produktkomposition.
How the reference pictures align with the target video — <Picture 1> (from [Shot 1]) aligns with the 8.00-second mark of the target video.
integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. An empty wet black-basalt plinth fills the foreground inside a dark greenhouse before sunrise. The camera pulls out with small amplitude at slow speed. From the left, a square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" slides smoothly onto the plinth and slows as it reaches center. Cold blue light from the right changes gradually to a narrow amber beam from the left. Water beads become visible on the bottle. During the final two seconds, every moving element comes to rest. The object placement, scale, camera view, reflections, label direction, fern shadows, and illumination now match <Picture 1>. No extra bottle, label, subtitle, or watermark appears.
overall_soundscape: Rain taps the greenhouse roof while glass slides softly over wet stone. The sliding sound slows and stops as one final drop strikes the plinth.
non_diegetic_music: Four muted glass harmonics sound at even intervals. The fourth ends as the bottle stops moving.
Rückwärtsplanung funktioniert am besten, wenn der Ausgangszustand nur wenige Änderungen erfordert.
Die erste Einstellung hat keinen Zeitstempel. Jede spätere Einstellung beginnt mit einer streng ansteigenden Schnittzeit innerhalb der Zieldauer.
MiniMax dokumentiert dieses Shot-Label-Muster; die Auslassungspunkte unten sind Platzhalter:
[Shot 1] Live-action, cinematic, a medium-wide shot establishes...
[Shot 2] At 00:03.500, the camera cuts to...
[Shot 3] At 00:06.250, the shot switches to...
Verwende keinen Zeitstempel für eine fortlaufende Aktion innerhalb einer Einstellung. Schreibe stattdessen beispielsweise „zur Hälfte der Einstellung“, wenn kein Schnitt erfolgt.
Nenne bei der Kameraführung zuerst die Bewegungsart. Ergänze Amplitude und Geschwindigkeit nur, wenn sie das gewünschte Ergebnis genauer beschreiben.
| Unklare Anweisung | Klarere Richtung |
|---|---|
| Filmische Kamera | Die Kamera fährt langsam und mit geringer Amplitude näher heran |
| Dynamische Bewegung | Die Kamera fährt schnell und mit großer Amplitude nach links |
| Auf das Etikett fokussieren | Die Kamera hält eine statische Nahaufnahme, während das Licht über das Etikett wandert |
| Das Produkt umkreisen | Die Kamera beschreibt langsam und mit kleiner Amplitude einen Bogen im Uhrzeigersinn |
Plane die Schnitte, bevor du die Prompt-Syntax schreibst. Der Leitfaden für KI-Storyboards erklärt, wie du Zweck und Kontinuität jeder Einstellung vor der Animation festlegst.
H3 generiert Videos mit nativem Stereo-Audio. Deshalb gehören die Audioanweisungen bereits in den ersten Prompt. Trenne diese vier Tonfunktionen.
| Tonfunktion | Wo eintragen? | Beispiel |
|---|---|---|
| Dialog oder Gesang | integrated_multimodal_description | (S1) says: <d>[English] Find your north.</d> |
| Synchronisiertes Ereignis | Aktuelle Aufnahme in der Timeline | Die Kappe rastet ein, wenn die Hand sie loslässt |
| Umgebung und physische Geräusche | overall_soundscape | Regen, Schritte, Kleidung, Stöße, Atmung |
| Nicht diegetische Musik | non_diegetic_music | Instrumentierung, Tempo, Rhythmus und Lautstärkeverlauf |
Weise (S1), (S2) und weitere IDs in der Reihenfolge zu, in der die Stimmen erstmals auftreten. Verknüpfe jede ID in allen Einstellungen mit derselben Stimme.
Setze nur das Sprach-Tag und den genauen gesprochenen Text in <d>. Sprecherbeschreibung, Handlung, Sprechweise und ID bleiben außerhalb des Tags.
The calm off-screen woman (S1) says: <d>[English] Find your north.</d>
The shopkeeper with a low, measured voice (S2) replies: <d>[English] It was here all along.</d>
Verwende für das Voice-over die ausdrückliche Formulierung von MiniMax und lass die Person im Bild den Mund geschlossen halten:
The woman (S1) says in an off-screen voiceover: <d>[English] I kept the first bottle.</d> while her lips remain completely closed.
Schreibe N/A unter non_diegetic_music, wenn du Atmosphäre und Effekte ohne nicht diegetische Musik wünschst. Verwende overall_soundscape: N/A nur, wenn du für den gesamten Clip völlige Stille verlangst.
Sichtbarer Text muss in doppelten Anführungszeichen stehen. Übernimm ihn einschließlich der Zeichensetzung exakt. Ein Etikett in Anführungszeichen kann die Anweisung klarer machen, garantiert aber keine fehlerfreie Textdarstellung.
Beginne mit der Struktur, bevor du Stilbegriffe änderst. Ändere jeweils eine Variable und vergleiche dann die nächste Ausgabe mit derselben Akzeptanzprüfung.
| Fehler | Wahrscheinliches Prompt-Problem | Korrektur des offiziellen Formats |
|---|---|---|
| Die falsche Person spricht | Die IDs haben gewechselt oder einem Sprecher wurde nie eine ID zugewiesen | Weise beim ersten Auftreten jeder Stimme feste IDs wie (S1) und (S2) zu und verwende sie weiter |
| Es erscheint unerwünschte Hintergrundmusik | Das Musikfeld war vage oder fehlte | Schreibe non_diegetic_music: N/A und behalte die gewünschten physischen Geräusche in overall_soundscape |
| Ein Zeitstempel scheint ignoriert zu werden | Der Zeitstempel markiert eine Aktion, keinen Schnitt, oder liegt außerhalb der Dauer | Setze Zeitstempel nur bei späteren Einstellungen und lass die Schnittzeiten innerhalb des Clips streng ansteigen |
| Das Video wird zufällig geschnitten | Kleinere Winkeländerungen wurden als separate Aufnahmen aufgezeichnet | Behalte eine Aufnahme und beschreibe die Kamerabewegung, es sei denn, ein Schnitt führt neue Informationen ein |
| FL2VA springt zwischen Endpunkten | Der Prompt wiederholt zwei statische Beschreibungen | Nenne beobachtbare Zwischenänderungen, die nach und nach das endgültige Bild erreichen |
| L2VA behandelt das Bild als Startbild | Die Ausrichtungslinie des letzten Frames oder die endgültige Konvergenz fehlt | Platziere die L2VA-Anweisung zuerst und lande erst am Ende auf dem Bild |
| Der sichtbare Text weicht ab | Der Text wurde paraphrasiert oder nicht zitiert | Setze den genauen Text in gerade doppelte Anführungszeichen und überprüfe anschließend das Ergebnis |
| Der Dialog wiederholt sich in der Geräuschkulisse | Gesprochene Wörter wurden in mehrere Felder kopiert | Schreibe den vollständigen Dialog nur innerhalb von <d> in die visuelle Zeitleiste |
Diese Korrekturen machen die Anweisungen klarer, garantieren aber nicht, dass jede Generierung jedes Detail befolgt.
Wenn ein Prompt Identität, Bewegung, Kamera und Stimme aus mehreren Quelldateien benötigt, erweitere dieses Basisformat nicht weiter. Nutze Ref2VA und den offiziellen vollständigen Referenzleitfaden.
Kopiere diese Checkliste in deine Produktionsnotizen:
[Shot 1] hat keinen Zeitstempel; spätere Schnittzeiten steigen an und bleiben innerhalb der Dauer.(Sx)-ID.<d> exakt erhalten.overall_soundscape.non_diegetic_music; ohne Musik enthält das Feld N/A.Die offizielle API-Referenz zu Video Generation V2 verlangt einen nicht leeren Text-Prompt. Sie trennt außerdem Rollen für Start- und Endframes von Rollen für Referenzmedien. Mische diese Rollenfamilien daher nicht in einer API-Anfrage.
Die beste Grundstruktur beginnt mit dem richtigen Modus und verwendet drei Felder: integrated_multimodal_description, overall_soundscape und non_diegetic_music. Setze bei I2VA, FL2VA oder L2VA davor die offizielle Bildausrichtungszeile.
T2VA beginnt mit Text, I2VA mit einem Startframe. FL2VA verbindet Start- und Endframe, während L2VA auf einen bereitgestellten Endframe hinarbeitet. Der Modus bestimmt die erste Prompt-Anweisung und die Richtung der visuellen Planung.
Weise jeder Stimme bei ihrem ersten Auftreten eine feste ID wie (S1) oder (S2) zu und verwende sie in allen Einstellungen weiter. Innerhalb von <d> stehen nur das Sprach-Tag und der gesprochene Text.
Beschreibe synchronisierte Effekte in der jeweiligen Einstellung und die allgemeine Geräuschkulisse in overall_soundscape. Schreibe anschließend non_diegetic_music: N/A, wenn du keine nicht diegetische Musik anfordern möchtest.
Ein Zeitstempel kann scheitern, wenn er eine Aktion statt eines Schnitts markiert, einen früheren Zeitpunkt wiederholt oder außerhalb des Clips liegt. Verwende Zeitstempel nur ab Shot 2 und ordne die Schnittzeiten streng aufsteigend an.
Für direkte H3-Base-Ref2VA-Prompts nutzt du das Format mit sechs Abschnitten: Motivdefinitionen, Zusammenfassung, Erhaltungsanalyse, detaillierter Ablauf, Geräuschkulisse und Musik. Die gehostete API akzeptiert einen nicht leeren Text-Prompt zusammen mit Referenzmedien; die vollständige Fassung muss daher nicht immer von Hand geschrieben werden.
Du kannst jetzt den passenden H3-Modus auswählen, die Zeitleiste schreiben und die Audioebenen sauber trennen. Speichere die passende Vorlage und gehe vor der nächsten Generierung die QA-Checkliste durch.
MiniMax H3 kommt in Kürze zu DomoAI. Wir informieren dich, sobald das Modell dort verfügbar ist.
Recent articles
© 2026 DOMOAI PET. GMBH
nach Moai