
Tabla de contenido

Prueba DomoAI, el mejor generador de animación con IA
Convierte cualquier texto, imagen o vídeo en vídeos de anime, realistas o artísticos. Más de 30 estilos únicos disponibles.
Reference-to-Video en MiniMax H3 funciona mejor cuando cada fuente tiene una función definida. Usa una imagen para la apariencia o la composición, un video para el movimiento o la cámara y un audio para una señal sonora. Indica después qué debe conservar, transferir o cambiar H3, y qué debe tratar solo como referencia general.
Un mismo recurso puede aportar varios sujetos o atributos. La regla de «una función por fuente» asigna una responsabilidad principal a cada archivo. Es un método de planificación, no un límite técnico de un solo recurso.
Reference-to-Video, o Ref2VA, combina texto con imágenes, videos o audios de referencia para guiar un nuevo clip audiovisual. Cada fuente puede definir identidad, apariencia, estilo, movimiento, cámara, tiempos, voz, efectos de sonido o música.
H3 no trata cada archivo como un fotograma. Una imagen puede definir la apariencia, un video puede guiar la cámara y un audio puede orientar el timbre.
La guía oficial de prompts con referencias completas de MiniMax formaliza esas relaciones mediante etiquetas, marcadores de conservación y una estructura de planificación de seis secciones.
Ese formato describe las relaciones previstas, pero no garantiza una identidad exacta, un comportamiento físico concreto, sincronización labial, tiempos, texto ni reproducción píxel por píxel.
Elige FL2VA cuando una imagen suministrada deba ocupar el primer fotograma, el último fotograma o ambos. Elige Ref2VA cuando las fuentes deban guiar atributos o comportamiento sin servir como puntos finales fijos.
| Necesidad | Modo H3 recomendado | Motivo |
|---|---|---|
| Comenzar desde una imagen inicial | Checkpoint de FL2VA en modo I2VA de primer fotograma | La imagen proporcionada fija el estado inicial |
| Llegar a una imagen final proporcionada | Checkpoint de FL2VA en modo L2VA | El prompt describe la transición hasta el estado final |
| Restringir la primera y la última imagen | Checkpoint de FL2VA en modo de primer y último fotograma | Ambos puntos finales son explícitos. |
| Usar identidad, estilo, movimiento, cámara o sonido de varias fuentes | Ref2VA | Cada fuente puede recibir un rol de referencia diferente |
| Combinar roles de API de primer/último fotograma con roles de referencia en una solicitud | No compatible con una única solicitud de API | La API oficial trata estas familias de roles como mutuamente excluyentes. |
La referencia de la API Video Generation V2 separa los roles de fotograma inicial/final de los roles de medios de referencia. Una solicitud de API no puede combinar ambas familias.
Cada referencia añade otra relación que H3 debe interpretar.
Usa este filtro de cinco comprobaciones antes de cargar:
Una foto de producto limpia suele guiar mejor la geometría que un collage recargado. Un clip de movimiento estable comunica mejor la intención de la cámara que un montaje rápido.
Planifica la toma antes de reunir las referencias. Esta guía de storyboard con IA ayuda a separar las decisiones de composición, acción y cámara antes de animar.
El repositorio H3 actual y la documentación del modelo de MiniMax enumeran estos límites locales de Ref2VA:
La API alojada requiere un prompt de texto que no esté vacío en cada solicitud. Su límite actual de cuerpo de solicitud es de 64 MB.
Las imágenes de referencia API pueden usar JPG, JPEG, PNG, WEBP, HEIC o HEIF. El video de referencia acepta MP4 o MOV, mientras que el audio de referencia acepta WAV o MP3.
Los requisitos de carga de API pueden cambiar, así que consulta la referencia actual de la API Video Generation V2 antes de enviar una solicitud.
MiniMax enumera ComfyUI como una opción de inferencia local. Las reglas de entrada locales y las reglas de solicitud de API alojadas pueden diferir.
Crea una ficha de funciones de referencia antes de redactar el prompt. Asigna a cada archivo una función principal y, si hace falta, una función secundaria.
| Fuente o etiqueta | Funciones principales adecuadas | Lo que no garantiza |
|---|---|---|
<Subject N> | Persona, objeto, entorno, acción, pose, efecto o estilo reutilizable abstraído de fuentes | Bloqueo perfecto de la identidad o equivalencia con un archivo cargado aparte |
<Picture N> | Fotograma concreto, composición, referencia de storyboard, disposición espacial o referencia de iluminación | Movimiento completo, estructura temporal o retención de geometría perfecta. |
<Video N> | Edición de fuente, continuación, patrón de movimiento, trayectoria de cámara, cortes, ritmo o estructura temporal | Reemplazo garantizado, física exacta o copia píxel por píxel |
<Audio N> | Timbre de voz, ritmo, señal de diálogo, efecto de sonido, rasgos musicales, continuidad o reutilización directa del audio. | Sincronización labial garantizada o entrada local de Ref2VA solo con audio |
Aquí está el formato de la hoja de trabajo:
| ID del recurso | Tipo | ¿Derechos autorizados? | Función principal | Función secundaria | Conservar, transferir o cambiar | Intervalo de tomas | Verificación de conflicto o aceptación |
|---|---|---|---|---|---|---|---|
| Picture 1 | Imagen | Sí | Aspecto y etiqueta de la botella. | Color del material | Conserva la geometría y la tapa negra mate. | Todas las tomas | La etiqueta permanece orientada hacia el frente |
| Picture 2 | Imagen | Sí | Ambiente de invernadero | Paleta del amanecer | Transferir solo el entorno, no sus accesorios | Todas las tomas | No aparece ningún segundo producto |
| Video 1 | Video | Sí | Arco de cámara en el sentido de las agujas del reloj | ritmo lento | Transferir solo la ruta de la cámara | Toma 1 | La botella no hereda la forma de la fuente |
| Audio 1 | Audio | Sí | Textura de campanilla de cristal | Momento del sonido final | Referenciar la textura sin copiar la señal | Toma 2 | Una campanilla nítida después del clic de la tapa |
Los criterios de aceptación permiten revisar cada función por separado.
Para proyectos de producto, la guía de coherencia en videos de producto añade comprobaciones de geometría y etiquetas.
Estas instrucciones no establecen una prioridad:
Use the silver cap from Picture 1 and the black cap from Picture 2. Keep both exact.
Esta versión asigna responsabilidad:
Picture 1 controls the bottle geometry, amber glass, matte-black cap, and label. Picture 2 controls only the greenhouse environment and dawn lighting; ignore the container shown in Picture 2.
Cuando una actuación de referencia importa más que su intérprete, establece ese límite explícitamente: Video 1 controla el movimiento y la cámara únicamente; ignora su intérprete y su entorno.
Mantén los números de etiquetas estables en las seis secciones.
<Subject N> designa contenido visible reutilizable o editable, como una persona, producto, entorno, acción, pose, interfaz o estilo.
<Subject 1> is the square amber-glass perfume bottle whose geometry, matte-black cap, and cream "NORTHLINE" label come from <Picture 1>.
Usa <Picture N> por separado cuando la imagen funcione como fotograma concreto o referencia de composición.
<Picture 3> is the first-frame composition anchor for [Shot 1], defining the bottle position, plinth angle, and empty space on the right.
Si una imagen solo define un Subject, cítala dentro de la definición de ese Subject.
Usa <Video N> para edición de la fuente, continuación, cámara, cortes, ritmo o estructura temporal. Las personas y los objetos extraídos aún necesitan etiquetas Subject.
Usa <Audio N> para la reutilización directa o referencia a voz, sincronización, ritmo, efectos o rasgos musicales. Los números de audio y video siguen siendo independientes.
La guía de referencia completa de MiniMax utiliza seis secciones en este orden:
subject_definitionssummaryretention_analysisdetailed_descriptionoverall_soundscapenon_diegetic_musicLa API alojada requiere texto, pero no exige que cada usuario redacte manualmente esta versión completa. H3-Context-IR puede procesar entradas multimodales de forma libre. Usa las seis secciones como un lenguaje de planificación preciso, no como un esquema de API obligatorio.
El siguiente ejemplo original aplica el formato documentado de MiniMax a una fotografía de producto ficticia.
Ficha de ejecución de ejemplo: Ref2VA · 8 segundos · 16:9 · tres imágenes · un video · una referencia de audio.
subject_definitions:
<Subject 1> is the square amber-glass perfume bottle whose geometry, matte-black cap, and cream "NORTHLINE" label come from <Picture 1>.
<Subject 2> is the greenhouse environment from <Picture 2>, with wet black-basalt surfaces, tall fern leaves, glass roof panels, and cold blue dawn light.
<Picture 3> is the first-frame composition anchor for [Shot 1], defining the bottle position, plinth angle, and empty space on the right.
<Video 1> provides the slow clockwise camera arc and measured pacing for [Shot 1], without providing product appearance.
<Audio 1> is the sound-texture reference for one clear glass chime heard after the cap click in [Shot 2].
summary:
[keyframe completion + reference generation + audio reference] The target video presents <Subject 1> inside <Subject 2>. It begins from the composition in <Picture 3>, follows the camera path from <Video 1>, and uses <Audio 1> only as a sound-texture reference for the final chime.
retention_analysis:
<Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved - the square amber-glass body, matte-black cap, cream "NORTHLINE" label, and front-facing product identity are retained.
<Subject 2> (appears in [Shot 1], [Shot 2]): fully_preserved - the wet basalt, fern leaves, glass roof, and cold blue dawn lighting are retained.
<Picture 3> ([Shot 1] first frame): fully_preserved - the opening bottle position, plinth angle, and right-side negative space are retained.
<Video 1> (camera path and pacing): partially_preserved - its slow clockwise arc and measured speed guide [Shot 1], while its source subjects and setting are excluded.
<Audio 1>: reference - its clean glass-chime texture guides one newly generated accent without copying the original signal.
detailed_description:
The target video uses a live-action cinematic product-film style with restrained movement and cool dawn lighting.
[Shot 1] The shot begins from <Picture 3>. <Subject 1>, the square amber-glass perfume bottle with a matte-black cap and cream "NORTHLINE" label, stands on the wet basalt plinth inside <Subject 2>. The camera follows the slow clockwise arc and measured pacing referenced from <Video 1>. Cold blue light enters from the right through the greenhouse roof. Water beads slide down the amber glass. Fern leaves move slightly behind the product. The bottle stays fixed, front-facing, and unchanged while the camera completes the arc. No second bottle, subtitle, or watermark appears.
[Shot 2] At 00:05.000, the camera cuts to a static close-up of <Subject 1>. A clean hand enters from the upper right, presses the matte-black cap down once, and releases it. The cap makes a dry click. A single newly generated glass chime follows, using the clear texture referenced from <Audio 1> without copying its signal. A narrow amber reflection crosses the cream "NORTHLINE" label from left to right. The hand exits. The bottle remains centered and readable through the final frame.
overall_soundscape:
Light rain taps on the glass roof throughout the video. Fern leaves brush softly in the background, while water drops strike the basalt and the cap produces one dry mechanical click.
non_diegetic_music:
N/A
El plan establece lo que cada fuente controla y excluye.
Asigna roles por toma porque una referencia puede ser importante solo para una parte del clip.
Usa este orden para cada toma:
La primera toma no lleva marca de tiempo. En las tomas posteriores, usa [Shot N] At MM:SS.mmm, ... con tiempos de corte en orden ascendente. Si dos videos guían el movimiento, asigna el movimiento del cuerpo a uno y la cámara al otro.
Elige el marcador de audio que coincida con la relación de señal deseada.
| Marcador | Significado en lenguaje sencillo |
|---|---|
fully_copy | Reutiliza todo el audio fuente como la pista de audio final completa |
partially_copy | Copia parte de la línea de tiempo o capas seleccionadas, con cambios en otros lugares |
reference | Genera nuevo audio guiado por timbre, ritmo, estilo, palabras, pulso o textura sonora. |
weak_reference | Mantén solo una categoría amplia o similitud atmosférica |
Cuando el audio guíe a un hablante objetivo, vincúlalo al mismo identificador estable (Sx) que se usa en detailed_description. Si solo transfieres el timbre, no copies el diálogo de origen al resultado.
Recuerda la restricción local: el audio no puede ser la única referencia multimedia para H3-Base-Ref2VA. Incluye una imagen o video.
Clasifica cada función prevista como conservada, conservada en parte, ausente o en conflicto.
| Comprobación | Pregunta |
|---|---|
| Identidad | ¿La persona u objeto deseado sigue siendo reconocible en las tomas? |
| Apariencia | ¿Están presentes los colores, la ropa, el material, la etiqueta o el estilo mencionados? |
| Geometría | ¿El producto mantuvo su forma definitoria y las relaciones entre piezas? |
| Movimiento | ¿La acción solicitada sigue el camino y el ritmo previstos? |
| Cámara | ¿Utilizó la cámara la dirección solicitada sin heredar contenido fuente no deseado? |
| Tiempo | ¿Cada referencia comenzó y terminó en el intervalo de tomas previsto? |
| Sonido | ¿Se copió, se hizo referencia o se generó nuevamente el audio según lo planeado? |
| Conflictos | ¿Dos referencias compitieron por el mismo atributo? |
Revisa una relación a la vez. Si solo falla la cámara, aclara que Video 1 controla únicamente la cámara y excluye el producto de la fuente.
Revisa las entradas oficiales y tu plan de funciones antes de atribuir el problema al modelo.
La caché, la cuantificación, el recuento de pasos, los nodos y la VRAM pueden afectar una configuración local específica. Sus efectos varían según la configuración.
H3-Base local produce video de 768p con audio estéreo nativo. La publicación incluye checkpoints de FL2VA y Ref2VA por separado.
El sistema completo también incluye H3-Context-IR y H3-Regenerate-2K alojados. Regenerate-2K utiliza el resultado de 768p más el contexto original para regenerar hasta 2K.
Regenerate-2K no es un reescalador convencional y no forma parte de la publicación actual de pesos abiertos. Por lo tanto, la descarga de Ref2VA por sí sola no proporciona el flujo de trabajo 2K local completo.
FL2VA fija el primer fotograma, el último o ambos. Ref2VA asigna funciones de identidad, estilo, movimiento, cámara, temporización o sonido a imágenes, videos y audios de referencia.
La ficha del modelo admite hasta 9 imágenes, 3 videos y 3 audios, con un máximo de 12 archivos combinados. La duración total de los videos y la de los audios no pueden superar los 15 segundos.
No en el flujo local de Ref2VA documentado. El audio de referencia debe acompañar a una imagen o un video. La API alojada aplica reglas de solicitud distintas.
No. La API requiere texto, pero no obliga a enviar las seis secciones de forma manual. Esa estructura es un método preciso para planificar la solicitud.
El video puede guiar un patrón de movimiento, una trayectoria de cámara, el ritmo o la estructura temporal. Trátalo como una guía, no como una reproducción garantizada.
H3-Base genera 768p en local. La ruta oficial a 2K depende de la etapa alojada Regenerate-2K, que no forma parte de la publicación actual de pesos abiertos.
Antes de tu próxima solicitud de Ref2VA, crea la ficha de funciones de referencia. Asigna una función principal a cada fuente y revisa el primer resultado según esa función.
MiniMax H3 llegará pronto a DomoAI. Compartiremos la novedad cuando esté disponible en DomoAI.
Artículos recientes
© 2026 DOMOAI PTE. LTD.
Domo AI