
Tabla de contenido

Prueba DomoAI, el mejor generador de animación con IA
Convierte cualquier texto, imagen o vídeo en vídeos de anime, realistas o artísticos. Más de 30 estilos únicos disponibles.
Los buenos prompts de MiniMax H3 comienzan con el modo correcto. Después separan la línea de tiempo visual, el diálogo, los sonidos físicos y la música no diegética. Esta guía ofrece plantillas originales y listas para copiar de T2VA, I2VA, FL2VA, L2VA y audio nativo. Cada plantilla sigue el formato oficial de MiniMax.
Una estructura correcta da instrucciones más claras a H3, pero no garantiza cortes, voces, texto, movimiento ni coincidencias exactas entre fotogramas.
Los prompts siguientes se basan en ejemplos de la documentación oficial de MiniMax.
Empieza con el material visual suministrado. No elijas un modo porque sus siglas suenan más avanzadas.
| Modo | Entrada suministrada | Primera tarea del prompt | Uso recomendado |
|---|---|---|---|
| T2VA | Ninguno | Establece la escena, los sujetos, la acción, los planos y el plan de audio completo. | Crea una nueva idea audiovisual a partir de texto |
| I2VA | Un primer fotograma | Haz referencia completa a la imagen de apertura y luego describe lo que sucede a continuación. | Animar una composición de apertura preparada. |
| FL2VA | Primer y último fotograma | Alinea ambas imágenes y describe un camino observable entre ellas. | Controlar la apertura y el final de una transición. |
| L2VA | Un último fotograma | Construye una secuencia anterior plausible que aterrice en el fotograma final suministrado. | Diseñar una revelación o transformación a partir del final |
| Ref2VA | Imágenes y/o videos de referencia, con audio opcional; el audio no puede ser la única entrada de referencia | Asigna a cada recurso una función dentro del formato de referencia completa | Guiar identidad, estilo, movimiento, cámara o sonido con varias fuentes |
MiniMax documenta estos cuatro modos básicos en su guía oficial de prompts base de H3. Ref2VA utiliza otro formato de planificación de seis secciones, por lo que corresponde a un flujo de trabajo avanzado independiente.
Piensa en el prompt básico como tres capas: línea de tiempo, sonidos físicos y música no diegética.
integrated_multimodal_description:
[Shot 1] Describe the subjects, setting, visible action, camera, dialogue, and any sound tied to this moment.
[Shot 2] At 00:03.000, describe the next visible and audible event.
overall_soundscape:
Describe ambience, physical sound effects, and non-verbal human sounds across the clip.
non_diegetic_music:
Describe the audience-only score, or write N/A when no score is wanted.
integrated_multimodal_description define el orden de reproducción. Incluye aquí los planos, la acción, el diálogo, el canto, el texto visible y el sonido sincronizado.
overall_soundscape abarca el sonido ambiente, el viento, el tráfico, los pasos, los impactos, el roce de la tela, la respiración y otros sonidos físicos. No repitas aquí el diálogo completo.
non_diegetic_music describe la música que solo escucha el público. Si la música procede de una radio o de un intérprete dentro de la escena, mantén ese evento en la línea de tiempo.
Usa este flujo de trabajo de siete partes:
T2VA no tiene línea de alineación de imagen. Comienza con los tres campos y establece todo desde el texto.
El siguiente ejemplo crea una presentación de producto de ocho segundos. La cláusula fija se mantiene idéntica en todos los planos: «a square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE"».
Antes de probar el prompt, enumera los detalles del producto que no deben variar. La guía de coherencia para videos de producto muestra cómo convertirlos en criterios de aceptación.
Ficha de ejecución: T2VA · 8 segundos · 16:9 · no se suministra imagen.
integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. A square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" stands on a wet black-basalt plinth inside a greenhouse before sunrise. Cold blue window light reaches the bottle from camera right. The camera makes a slow, small-amplitude push toward the plinth. Water beads slide down the glass while fern leaves move gently behind it. [Shot 2] At 00:04.000, the camera cuts to a close-up of the same square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE". A narrow amber light sweeps from left to right across the bottle. The label stays front-facing and readable. One water bead reaches the base as a quiet off-screen woman (S1) says: <d>[English] Find your north.</d> The shot holds steady through the final frame. No extra bottle, label, subtitle, or watermark appears.
overall_soundscape: Light greenhouse rain taps on the glass roof. Leaves rustle softly while water drops strike the basalt surface. A low room tone continues beneath the voice.
non_diegetic_music: Three isolated felt-piano strikes sound during the first half. A bowed-glass drone rises twice, then stops two seconds before the end.
La etiqueta, la voz, el barrido de luz y la gota de agua sincronizada van en la línea de tiempo. La lluvia y el movimiento de las hojas van en el paisaje sonoro.
I2VA trata la imagen proporcionada como el primer fotograma real en el segundo 0.00. Usa la primera línea fija de MiniMax y describe a partir de lo que la imagen ya establece.
No rediseñes el primer fotograma con palabras. Antes de añadir movimiento, conserva el producto, la composición, la iluminación, los colores y las relaciones espaciales visibles.
Ficha de ejecución: I2VA · 8 segundos · fotograma de origen 16:9 · Picture 1 proporciona el plano inicial del producto.
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. The square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" remains in the position, scale, lighting, and greenhouse composition established by <Picture 1>. The camera arcs clockwise with small amplitude at slow speed. Water beads move down the glass while the background fern leaves shift in a light draft. A narrow amber reflection begins at the bottle's left edge and travels across its front face. The label remains front-facing and readable. At the end, the camera stops and holds the original product as the brightest object. No extra bottle, label, subtitle, or watermark appears.
overall_soundscape: Soft rain taps the greenhouse roof while leaves brush against one another. Water drops strike the basalt plinth at irregular intervals.
non_diegetic_music: A muted handpan sounds once every two seconds. One airy synthesizer tone enters halfway and recedes before the final frame.
El prompt nombra solo los cambios que pueden desarrollarse a partir de la imagen. Evita reemplazar el producto y la escena mientras se mueve la cámara.
FL2VA ancla ambos extremos. El prompt debe explicar la ruta visible entre Picture 1 y Picture 2.
Usa un solo plano cuando quieras una interpolación continua. Añade cortes solo cuando el plan creativo realmente los requiera.
Ficha de ejecución: FL2VA · 8 segundos · fotogramas de origen 16:9 coincidentes · Picture 1 en 0.00 · Picture 2 en 8.00.
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 8.00-second mark of the target video.
integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. At the opening instant, Picture 1 determines the square amber-glass perfume bottle's location, size, and framing. It has a matte-black cap and a cream label reading "NORTHLINE". The camera trucks right with small amplitude at slow speed. A thin stream of water crosses the basalt plinth from left to right. The greenhouse light shifts gradually from cold blue dawn toward Picture 2's warm amber direction. Fern shadows travel across the background, then settle. The bottle does not rotate, and its label remains front-facing. By the last frame, the camera, water, reflections, shadows, and lighting match Picture 2's spacing, viewing angle, and composition. No extra bottle, label, subtitle, or watermark appears.
overall_soundscape: Rain decreases gradually as water runs across the stone. The final drops become farther apart before the scene settles into quiet greenhouse ambience.
non_diegetic_music: N/A
Un buen prompt FL2VA nombra el movimiento intermedio: recorrido de cámara, posición del agua, cambio de luz y movimiento de las sombras.
L2VA convierte Picture 1 en el final, no en el inicio. Elige un estado anterior plausible que pueda llegar a ese fotograma dentro del tiempo disponible.
La línea oficial usa el número del plano final y una duración efectiva con exactamente dos decimales. Por tanto, un prompt de un solo plano y ocho segundos termina en 8.00-second y usa Shot 1.
Ficha de ejecución: L2VA · 8 segundos · fotograma final 16:9 proporcionado · Picture 1 define la composición final del producto.
How the reference pictures align with the target video — <Picture 1> (from [Shot 1]) aligns with the 8.00-second mark of the target video.
integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. An empty wet black-basalt plinth fills the foreground inside a dark greenhouse before sunrise. The camera pulls out with small amplitude at slow speed. From the left, a square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" slides smoothly onto the plinth and slows as it reaches center. Cold blue light from the right changes gradually to a narrow amber beam from the left. Water beads become visible on the bottle. During the final two seconds, every moving element comes to rest. The object placement, scale, camera view, reflections, label direction, fern shadows, and illumination now match <Picture 1>. No extra bottle, label, subtitle, or watermark appears.
overall_soundscape: Rain taps the greenhouse roof while glass slides softly over wet stone. The sliding sound slows and stops as one final drop strikes the plinth.
non_diegetic_music: Four muted glass harmonics sound at even intervals. The fourth ends as the bottle stops moving.
La planificación hacia atrás funciona mejor cuando el estado inicial requiere pocos cambios.
El primer plano no lleva marca de tiempo. Cada plano posterior comienza con un tiempo de corte estrictamente creciente y dentro de la duración objetivo.
MiniMax documenta este patrón de etiquetas de plano; los puntos suspensivos siguientes son marcadores de posición:
[Shot 1] Live-action, cinematic, a medium-wide shot establishes...
[Shot 2] At 00:03.500, the camera cuts to...
[Shot 3] At 00:06.250, the shot switches to...
No uses una marca de tiempo para describir una acción continua dentro de una sola toma. Usa prosa como “a mitad de la toma” cuando no se produzca un corte.
La dirección de la cámara necesita primero un tipo de movimiento. Añade amplitud y velocidad sólo cuando ayuden a definir el resultado.
| Dirección poco precisa | Dirección más clara |
|---|---|
| Cámara cinematográfica | La cámara se acerca lentamente con un movimiento de poca amplitud |
| Movimiento dinámico | La cámara se desplaza hacia la izquierda, rápido y con gran amplitud |
| Centrarse en la etiqueta | La cámara mantiene un primer plano estático mientras la luz atraviesa la etiqueta. |
| Rodear el producto | La cámara describe un arco en sentido horario, lentamente y con poca amplitud |
Planifica los cortes antes de escribir la sintaxis del prompt. La guía de storyboard para videos con IA explica cómo definir el propósito y la continuidad de cada plano antes de animar.
H3 genera video con audio estéreo nativo, por lo que las indicaciones de audio deben formar parte del prompt inicial. Mantén separadas estas cuatro funciones sonoras.
| Función sonora | Dónde escribirla | Ejemplo |
|---|---|---|
| Diálogo o canto | integrated_multimodal_description | (S1) says: <d>[English] Find your north.</d> |
| Evento sincronizado | Toma actual en la línea de tiempo. | La tapa se cierra con un clic cuando la mano la suelta. |
| Ambiente y sonidos físicos | overall_soundscape | Lluvia, pasos, tela, impactos, respiración. |
| Música no diegética | non_diegetic_music | Instrumentación, tempo, ritmo y cambio de volumen. |
Asigna (S1), (S2) y los identificadores siguientes según el orden en que aparezcan las voces. Mantén cada identificador asociado a la misma voz en todos los planos.
Coloca dentro de <d> solo la etiqueta de idioma y las palabras exactas. Deja fuera la descripción del hablante, la acción, la interpretación y el identificador.
The calm off-screen woman (S1) says: <d>[English] Find your north.</d>
The shopkeeper with a low, measured voice (S2) replies: <d>[English] It was here all along.</d>
Para la voz en off, usa la frase explícita de MiniMax y mantén cerrada la boca en pantalla:
The woman (S1) says in an off-screen voiceover: <d>[English] I kept the first bottle.</d> while her lips remain completely closed.
Escribe N/A en non_diegetic_music cuando quieras ambiente y efectos sin música no diegética. Usa overall_soundscape: N/A solo cuando solicites silencio absoluto durante todo el clip.
El texto visible necesita comillas dobles. Cópialo exactamente, incluida la puntuación. Citar una etiqueta puede mejorar la claridad de las instrucciones, pero no garantiza una representación perfecta del texto.
Empieza por la estructura antes de cambiar los términos de estilo. Modifica una sola variable cada vez y compara el resultado siguiente con los mismos criterios de aceptación.
| Fallo | Posible problema del prompt | Corrección de formato oficial |
|---|---|---|
| Habla la persona equivocada | Las identificaciones cambiaron o nunca se estableció un hablante | Asigna identificadores estables (S1) y (S2) cuando aparezca cada voz por primera vez y reutilízalos después |
| Aparece música de fondo no deseada | El campo de música era impreciso o faltaba | Escribe non_diegetic_music: N/A y conserva los sonidos físicos deseados en overall_soundscape |
| Una marca de tiempo parece ignorada | La marca de tiempo señala una acción, no un corte, o queda fuera de la duración | Usa marcas de tiempo solo en los planos posteriores y mantén los tiempos de corte estrictamente crecientes dentro del clip |
| El video introduce cortes aleatorios | Los cambios de ángulo pequeños se escribieron como planos separados | Mantén una toma y describe el movimiento de la cámara a menos que un corte introduzca nueva información. |
| FL2VA salta entre puntos finales | El prompt repite dos descripciones estáticas. | Describe cambios intermedios observables que conduzcan de forma gradual al fotograma final |
| L2VA trata la imagen como una apertura | Falta la línea de alineación del último fotograma o la convergencia final | Coloca primero la instrucción L2VA y llega a la imagen solo al final |
| El texto visible cambia | El texto se parafraseó o no se escribió entre comillas | Conserva el texto exacto entre comillas dobles en inglés y luego revisa el resultado |
| El diálogo se repite en el paisaje sonoro. | Las palabras habladas se copiaron en varios campos. | Mantén el diálogo completo solo dentro de <d> en la línea de tiempo visual |
Estas correcciones mejoran la claridad de las instrucciones, pero no garantizan que cada generación respete todos los detalles.
Si un prompt necesita identidad, movimiento, cámara y voz de varios archivos de origen, deja de ampliar este formato básico. Usa Ref2VA y la guía oficial de referencia completa.
Copia esta lista de verificación en tus notas de producción:
[Shot 1] no tiene marca de tiempo; los tiempos de corte posteriores aumentan y permanecen dentro de la duración.(Sx).<d> el idioma y la redacción exactos.overall_soundscape.non_diegetic_music; si no se necesita, el campo indica N/A.La referencia oficial de la API Video Generation V2 exige un prompt de texto no vacío. También separa los roles del primer y último fotograma de los roles de medios de referencia; no mezcles ambas familias en una sola solicitud.
La mejor estructura básica comienza con el modo correcto y usa tres campos: integrated_multimodal_description, overall_soundscape y non_diegetic_music. Añade la línea oficial de alineación de imágenes antes de esos campos para I2VA, FL2VA o L2VA.
T2VA parte de texto; I2VA, de un primer fotograma; FL2VA conecta el primero con el último; y L2VA termina en un último fotograma proporcionado. Cada modo cambia la primera instrucción del prompt y la dirección del plan visual.
Asigna identificadores estables como (S1), (S2) y los siguientes cuando aparezca cada voz por primera vez. Reutiliza cada identificador en todos los planos y coloca dentro de <d> solo la etiqueta de idioma y las palabras pronunciadas.
Describe los efectos sincronizados dentro del plano y el ambiente general en overall_soundscape. Después escribe non_diegetic_music: N/A para no solicitar música no diegética.
Una marca de tiempo puede fallar si señala una acción en vez de un corte, repite un momento anterior o queda fuera del clip. Úsala solo en el Plano 2 y los posteriores, con tiempos de corte estrictamente crecientes.
Para prompts directos de H3-Base Ref2VA, usa el formato de seis secciones: definición de sujetos, resumen, conservación, reproducción detallada, ambiente sonoro y música. La API alojada acepta un prompt de texto no vacío con medios de referencia, por lo que no es obligatorio redactar a mano las seis secciones.
Ya puedes elegir el modo H3 correcto, escribir la línea de tiempo y separar cada capa de audio. Guarda la plantilla correspondiente y completa la lista de control de calidad antes de tu próxima generación.
MiniMax H3 llegará pronto a DomoAI. Compartiremos la noticia cuando esté disponible en la plataforma.
Artículos recientes
© 2026 DOMOAI PTE. LTD.
Domo AI