
Tabla de contenido

Prueba DomoAI, el mejor generador de animación con IA
Convierte cualquier texto, imagen o vídeo en vídeos de anime, realistas o artísticos. Más de 30 estilos únicos disponibles.
MiniMax H3 es el sistema omnimodal de propósito general de MiniMax para generar vídeo con audio estéreo nativo a partir de texto, imágenes, vídeo y audio de contexto. MiniMax M3 es un modelo independiente para programación y tareas agénticas. Hailuo AI es una aplicación orientada al usuario, mientras que Hailuo 2.3 es un modelo de vídeo anterior.
H3 es un lanzamiento reciente, por lo que los detalles de acceso y los controles específicos de cada implementación pueden cambiar.
MiniMax lanzó H3 el 31 de julio de 2026. La empresa lo describe como un modelo de generación multimodal de propósito general. Su ficha del modelo actual utiliza el término más específico «sistema generativo omnimodal».
Ambas descripciones expresan la misma idea: H3 puede interpretar varios tipos de medios dentro de un mismo contexto y generar conjuntamente un vídeo corto y audio estéreo nativo.
El lanzamiento oficial de MiniMax H3 y la ficha del modelo H3 documentan estas especificaciones actuales:
| Dato | Especificación actual | Alcance |
|---|---|---|
| Nombre oficial del modelo | MiniMax H3 | Página de lanzamiento y ficha del modelo de MiniMax |
| ID del modelo API | MiniMax-H3 | API alojada Video Generation V2 |
| Entradas de contexto | Texto, imágenes, vídeo y audio | Las combinaciones exactas dependen del modo y de la superficie de acceso. |
| Salida documentada | video con audio estéreo nativo | API alojada y checkpoints H3-Base publicados |
| Duración | 4 a 15 segundos | Especificaciones del servicio alojado y la API |
| Velocidad de fotogramas | 24 fps | Ficha del modelo H3 |
| Audio | Estéreo a 32 kHz | Ficha del modelo H3 |
| Resolución | H3-Base genera a 768p; H3 alcanza hasta 2K a través de Regenerate-2K o la API de extremo a extremo | No trates el H3-Base local como el sistema 2K completo |
| Pesos publicados | H3-Base FL2VA y H3-Base Ref2VA | Publicación de pesos abiertos bajo una licencia personalizada |
«Omnimodal» no significa que todos los productos de MiniMax se hayan fusionado en un único endpoint. La API de H3 documentada y los checkpoints publicados se centran en la generación conjunta de vídeo y audio.
El entrenamiento de H3 abarca tareas más amplias, pero eso no crea productos H3 públicos independientes solo para imágenes, música o audio. La oferta actual del producto importa más que la lista de tareas de entrenamiento.
La forma más sencilla de entender estos nombres es separar los modelos de los productos. MiniMax es la empresa. H3 y M3 son modelos diferentes. Hailuo AI es una aplicación creativa, mientras que Hailuo 2.3 es un modelo de video específico.
| Nombre | Qué es | Función principal | Distinción clave |
|---|---|---|---|
| MiniMax H3 | Sistema de generación omnimodal de propósito general | Generar vídeo y audio estéreo nativo a partir de contexto multimodal | ID oficial de API: MiniMax-H3 |
| MiniMax M3 | Modelo multimodal nativo separado | Programación, tareas agénticas, uso del ordenador y tareas de contexto largo | Acepta entrada de imagen y video, pero su función oficial difiere del H3 |
| Hailuo AI | Aplicación web de MiniMax orientada al usuario | Ofrece a los creadores una interfaz para la generación de medios. | MiniMax la enlaza como interfaz oficial de H3 |
| Hailuo 2.3 | Modelo de video MiniMax específico lanzado en octubre de 2025 | Generación de video | MiniMax lo describió como una evolución de Hailuo 02 |
| “Hailuo H3” o “Hailuo 3.0” | Terminología utilizada en búsquedas y comunidades | Ayuda a algunos usuarios a encontrar la nueva versión. | MiniMax no usa estos términos como nombre oficial del modelo H3 |
Esta distinción evita dos errores comunes. H3 no es la edición de video de M3. Hailuo 2.3 no es otro nombre oficial para H3.
H3 y M3 manejan más de un tipo de entrada. Esa palabra compartida, multimodal, causa gran parte de la confusión.
La diferencia práctica está en sus funciones y resultados.
| Dimensión | MiniMax H3 | MiniMax M3 |
|---|---|---|
| Resultado principal | Vídeo corto con audio estéreo nativo | Respuestas, código, razonamiento y resultados de tareas basados en herramientas |
| Escala de la tarea principal | Un clip objetivo de 4 a 15 segundos | Programación y tareas agénticas con ventanas de contexto de hasta un millón de tokens |
| Uso habitual | Escenas generadas, clips de productos, animaciones de carteles o videos basados en referencias. | Tareas de código, análisis, uso de la computadora o agentes de larga duración |
El lanzamiento oficial de M3 de MiniMax describe M3 como un modelo multimodal nativo. Acepta imágenes y vídeo como entrada, por lo que sería incorrecto presentarlo como un modelo solo de texto.
Esa compatibilidad de entrada no convierte M3 en el endpoint de vídeo H3. MiniMax orienta M3 a la programación y las tareas agénticas, y H3 a la generación audiovisual.
Considera un proyecto de lanzamiento de producto. M3 podría inspeccionar un resumen de diseño, revisar capturas de pantalla de la interfaz de usuario, analizar un repositorio o ayudar a coordinar tareas. H3 podría utilizar imágenes de productos, referencias de movimiento y dirección de audio para generar un clip corto.
Los modelos pueden apoyar el mismo proyecto más amplio. No desempeñan el mismo papel.
Hailuo aparece tanto en los nombres de productos como de modelos. Eso hace que la relación sea menos obvia que la distinción entre H3 y M3.
MiniMax enlaza Hailuo AI en la sección «Online App» del repositorio de H3. Es una interfaz de producto desde la que los usuarios pueden acceder a las funciones de generación multimedia de MiniMax.
Eso no convierte Hailuo en el nombre oficial de la API de todos los modelos subyacentes. Los nombres de producto y de modelo pueden coexistir.
MiniMax anunció Hailuo 2.3 el 28 de octubre de 2025. La versión oficial de Hailuo 2.3 dice que se basó en Hailuo 02.
MiniMax enmarcó esa actualización en torno al movimiento físico, la estilización, las microexpresiones de los personajes y la respuesta a los comandos de movimiento. Esas descripciones provienen del propio material de lanzamiento de MiniMax.
Hailuo 2.3 y H3 tienen nombres oficiales y páginas de lanzamiento separados. Las fuentes disponibles no dicen que H3 haya cambiado de nombre o reemplazado directamente a Hailuo 2.3.
Algunas páginas de terceros y usuarios llaman al nuevo modelo “Hailuo H3”, “Hailuo 3.0” o “Hailuo 03”. Estos términos pueden ayudar a identificar la intención de búsqueda, pero no deberían definir el producto.
A fecha del 7 de agosto de 2026, la página de lanzamiento y la ficha del modelo de MiniMax usan «MiniMax H3» en el texto. La API Video Generation V2 requiere el ID de modelo MiniMax-H3.
H3 admite varios patrones de entrada dentro de un mismo sistema de generación de vídeo. El patrón adecuado depende de si empiezas con una idea, un fotograma o varios recursos de referencia.
Con la conversión de texto a video, describes temas, acciones, escenarios, comportamiento de la cámara, diálogos, efectos de sonido, ambiente y música. H3 genera las pistas visuales y de audio juntas.
Este enfoque difiere de los flujos que primero generan un clip sin sonido y también de añadir audio de biblioteca después. El audio nativo permite que el modelo trate la acción visible y el sonido como partes de una misma secuencia objetivo.
Eso no garantiza diálogos precisos, sincronización del sonido o música en cada intento. Significa que el modelo representa conjuntamente esos canales de salida.
El checkpoint H3-Base FL2VA admite cero, una o dos imágenes de entrada.
Estos modos permiten partir de una composición aprobada o definir los extremos de una transición. No garantizan que todos los fotogramas intermedios conserven cada detalle de las fuentes.
El checkpoint H3-Base Ref2VA acepta imágenes de referencia, videos y audio junto con texto. Cada fuente puede guiar una parte diferente del resultado solicitado.
Por ejemplo, una imagen puede definir un personaje o un producto. Un vídeo puede guiar el movimiento o el comportamiento de la cámara. Un clip de audio puede guiar una voz, el ritmo o la relación entre sonidos.
El ejemplo oficial de MiniMax combina el movimiento de cámara de un vídeo, un personaje de una imagen y la voz de una fuente de audio. El modelo interpreta la relación entre estos elementos mediante texto.
La ficha del modelo limita la cantidad y la duración de las referencias. También indica que, en los flujos Ref2VA locales, el audio de referencia no puede ser la única entrada multimedia.
H3 genera actualmente clips de 4 a 15 segundos. La ficha del modelo especifica 24 fps y audio estéreo a 32 kHz.
H3-Base produce una salida de 768p. El flujo de trabajo 2K documentado de MiniMax combina H3-Base con las API alojadas Context-IR y Regenerate-2K. La API video Generation V2 de extremo a extremo también puede devolver una salida de 2K.
La referencia oficial de la API Video Generation V2 sigue siendo la mejor fuente para consultar las opciones actuales de solicitud y salida.
MiniMax afirma que sus primeras pruebas mostraron un buen seguimiento de instrucciones, renderizado de texto y marcas, y transferencia de movimiento de vídeo a vídeo. Son afirmaciones del proveedor, no resultados independientes de este artículo.
El sistema H3 completo tiene tres partes. Sus límites explican el flujo de trabajo a 2K y qué componentes se publicaron con pesos abiertos.
TEXTO + IMÁGENES + VIDEO + AUDIO
│
▼
H3-Context-IR — servicio alojado de interpretación del contexto
│
▼
H3-Base — pesos abiertos, generación audiovisual en 768p
│
▼
H3-Regenerate-2K — regeneración 2K alojada y sensible al contexto
Context-IR interpreta cómo los medios suministrados se relacionan con la salida solicitada. Luego, H3-Base genera video de 768p y audio estéreo. Regenerate-2K usa ese resultado y el contexto original para crear la versión de mayor resolución.
MiniMax publicó los pesos H3-Base FL2VA y Ref2VA. La publicación actual de pesos abiertos no incluye Context-IR ni Regenerate-2K.
Por eso, «pesos abiertos» describe el sistema H3 completo con más precisión que «totalmente open source». Los materiales descargables se rigen por una licencia comunitaria personalizada de MiniMax H3.
El amplio soporte de contexto de H3 no elimina las limitaciones normales del video generado.
Primero, cada salida dura de 4 a 15 segundos. Un anuncio, una película o una historia de producto más extensos aún necesitan varias tomas y una línea de tiempo de edición.
En segundo lugar, los controles dependen de la interfaz de acceso. Que el modelo subyacente tenga una capacidad no demuestra que todas las aplicaciones ofrezcan los mismos tipos de entrada, ajustes o límites.
En tercer lugar, las entradas de referencia guían el resultado en lugar de garantizar una copia exacta. Los movimientos complejos, los diálogos, los textos pequeños, las identidades y las relaciones con las fuentes aún necesitan revisión.
Finalmente, MiniMax dice que H3 tiene margen para mejorar en comprensión multimodal, escala del modelo y detalle visual. Esa nota aparece en la propia hoja de ruta de lanzamiento de la compañía.
Trata los ejemplos de lanzamiento como demostraciones, no como garantías. Prueba tus propios temas, referencias, texto, diálogo y movimiento antes de elegir un flujo de trabajo de producción.
MiniMax presenta H3 como modelo para la producción audiovisual de formato corto. Sus ejemplos oficiales incluyen títulos de películas, páginas de productos, carteles animados, publicidad y comercio electrónico.
La empresa también menciona branding, diseño de producto, UI/UX y videojuegos como áreas objetivo. Estas categorías apuntan a varios casos de uso prácticos.
H3 todavía produce clips cortos. Las historias más largas requieren planificación de tomas, generación, revisión y edición repetidas.
Los nombres son más sencillos de lo que parecen: usa MiniMax H3 para el modelo audiovisual, MiniMax M3 para programación y tareas agénticas, Hailuo AI para la aplicación orientada al usuario y Hailuo 2.3 para el modelo de vídeo anterior.
MiniMax H3 llegará pronto a DomoAI. Compartiremos la noticia cuando esté disponible.
Artículos recientes
© 2026 DOMOAI PTE. LTD.
Domo AI