
Table des matières

Essayez DomoAI, le meilleur générateur d'animation IA
Transformez n'importe quel texte, image ou vidéo en vidéos animées, réalistes ou artistiques. Plus de 30 styles uniques disponibles.
MiniMax H3 est le système omnimodal généraliste de MiniMax pour générer des vidéos avec audio stéréo natif à partir de texte, d’images, de vidéos et d’audio de référence. MiniMax M3 est un modèle distinct dédié au code et aux tâches agentiques. Hailuo AI est une application destinée aux utilisateurs, tandis que Hailuo 2.3 est un modèle vidéo antérieur.
H3 vient d’être lancé : les modalités d’accès et les contrôles propres à chaque implémentation peuvent donc évoluer.
MiniMax a lancé H3 le 31 juillet 2026. L’entreprise le présente comme un modèle de génération multimodale généraliste. Sa fiche de modèle actuelle emploie le terme plus précis de « système génératif omnimodal ».
Ces deux descriptions renvoient à la même idée : H3 peut interpréter plusieurs types de médias dans un même contexte, puis générer conjointement une courte vidéo et un audio stéréo natif.
Le lancement officiel de MiniMax H3 et la fiche du modèle H3 présentent les spécifications actuelles suivantes :
| Article | Spécifications actuelles | Portée |
|---|---|---|
| Nom officiel du modèle | MiniMax H3 | Page de lancement et fiche du modèle MiniMax |
| ID du modèle d'API | MiniMax-H3 | API hébergée Video Generation V2 |
| Entrées contextuelles | Texte, images, vidéo et audio | Les combinaisons exactes dépendent du mode et de l’interface d’accès |
| Sortie documentée | Vidéo avec audio stéréo natif | API hébergée et checkpoints H3-Base publiés |
| Durée | 4 à 15 secondes | Spécifications du service hébergé et de l’API |
| Fréquence d'images | 24 images par seconde | Carte modèle H3 |
| Audio | Stéréo 32 kHz | Carte modèle H3 |
| Résolution | H3-Base génère à 768p ; H3 atteint jusqu'à 2K via Regenerate-2K ou l'API de bout en bout | Ne considérez pas H3-Base en local comme un système 2K complet. |
| Poids publics | H3-Base FL2VA et H3-Base Ref2VA | Publication de poids ouverts sous licence personnalisée |
« Omnimodal » ne signifie pas que tous les produits MiniMax ont été regroupés dans un endpoint unique. L’API H3 documentée et les checkpoints publiés se concentrent sur la génération conjointe de vidéo et d’audio.
L’entraînement de H3 couvre des tâches plus larges, sans pour autant créer des produits H3 publics distincts réservés à l’image, à la musique ou à l’audio. L’offre produit actuelle compte davantage que la liste des tâches d’entraînement.
Le moyen le plus simple de comprendre ces noms est de séparer les modèles des produits. MiniMax est l'entreprise. H3 et M3 sont des modèles différents. Hailuo AI est une application créative, tandis que Hailuo 2.3 est un modèle vidéo spécifique.
| Nom | Qu'est-ce que c'est | Fonction principale | Distinction clé |
|---|---|---|---|
| MiniMax H3 | Système de génération omnimodal à usage général | Générer de la vidéo et de l’audio stéréo natif à partir d’un contexte multimodal | Identifiant API officiel : MiniMax-H3 |
| MiniMax M3 | Modèle multimodal natif distinct | Code, tâches agentiques, utilisation de l’ordinateur et tâches à contexte long | Accepte des images et des vidéos en entrée, mais son rôle officiel diffère de celui de H3 |
| Hailuo IA | Application Web MiniMax destinée à l'utilisateur | Donne aux créateurs une interface pour la génération de médias | MiniMax le référence comme interface officielle pour H3 |
| Hailuo 2.3 | Modèle vidéo MiniMax spécifique sorti en octobre 2025 | Génération vidéo | MiniMax le présente comme une évolution de Hailuo 02 |
| "Hailuo H3" ou "Hailuo 3.0" | Terminologie employée dans les recherches et les communautés | Aide certains utilisateurs à trouver la nouvelle version | MiniMax n’utilise pas ces termes comme nom officiel du modèle H3 |
Cette distinction évite deux erreurs courantes. H3 n'est pas l'édition vidéo de M3. Hailuo 2.3 n'est pas un autre nom officiel pour H3.
H3 et M3 gèrent tous deux plusieurs types d’entrée. Ce mot partagé – multimodal – provoque une grande partie de la confusion.
La différence pratique tient à leurs fonctions et à leurs résultats.
| Dimensions | MiniMax H3 | MiniMax M3 |
|---|---|---|
| Sortie principale | Courte vidéo avec audio stéréo natif | Réponses, code, raisonnement et résultats de tâches pilotés par des outils |
| Échelle des tâches principales | Un clip cible de 4 à 15 secondes | Code et tâches agentiques avec des fenêtres de contexte allant jusqu’à un million de tokens |
| Choix typique | Scènes générées, vidéos de produit, affiches animées ou vidéos guidées par des références | Code, analyse, utilisation de l'ordinateur ou tâches d'agent de longue durée |
Dans son communiqué officiel sur M3, MiniMax décrit M3 comme nativement multimodal. Il accepte des images et des vidéos en entrée ; le présenter comme un modèle limité au texte serait donc inexact.
Cette prise en charge des entrées ne transforme pas M3 en endpoint vidéo H3. MiniMax positionne M3 sur le code et les tâches agentiques, et H3 sur la génération audiovisuelle.
Prenons un projet de lancement de produit. M3 pourrait analyser un brief de conception, examiner des captures d’écran d’interface, parcourir un dépôt de code ou coordonner des tâches. H3 pourrait utiliser des images du produit, des références de mouvement et des indications audio pour générer un court clip.
Les modèles peuvent prendre en charge le même projet plus large. Ils ne remplissent pas le même rôle.
Hailuo apparaît à la fois dans la dénomination du produit et du modèle. Cela rend la relation moins évidente que la distinction entre H3 et M3.
MiniMax référence Hailuo AI dans la section « Online App » du dépôt H3. Il s’agit d’une interface produit depuis laquelle les utilisateurs peuvent accéder aux fonctions de génération multimédia de MiniMax.
Cela ne fait pas de Hailuo le nom officiel de l’API de tous les modèles sous-jacents. Les noms de produits et de modèles peuvent coexister.
MiniMax a annoncé Hailuo 2.3 le 28 octobre 2025. Le communiqué officiel indique que ce modèle s’appuie sur Hailuo 02.
MiniMax a structuré cette mise à jour autour du mouvement physique, de la stylisation, des micro-expressions des personnages et de la réponse aux commandes de mouvement. Ces descriptions proviennent du propre matériel de lancement de MiniMax.
Hailuo 2.3 et H3 ont des noms officiels et des pages de lancement distincts. Les sources disponibles n’indiquent pas que H3 a été renommé ou qu’il remplace directement Hailuo 2.3.
Certaines pages et utilisateurs tiers appellent le nouveau modèle « Hailuo H3 », « Hailuo 3.0 » ou « Hailuo 03 ». Ces termes peuvent aider à identifier l’intention de recherche, mais ils ne doivent pas définir le produit.
Depuis le 7 août 2026, la page de lancement et la carte de modèle de MiniMax utilisent « MiniMax H3 » en prose. L'API Video Generation V2 nécessite l'ID du modèle MiniMax-H3.
H3 prend en charge plusieurs modes d’entrée au sein d’un même système de génération vidéo. Le mode adapté dépend de votre point de départ : une idée, une image ou plusieurs ressources de référence.
Avec la synthèse texte-vidéo, vous décrivez les sujets, l'action, le décor, le comportement de la caméra, les dialogues, les effets sonores, l'ambiance et la musique. H3 génère les pistes visuelles et audio ensemble.
Ce fonctionnement diffère des workflows qui génèrent d’abord un clip muet, ainsi que de l’ajout d’un audio de bibliothèque après la génération. L’audio natif permet au modèle de traiter l’action visible et le son comme les composantes d’une même séquence cible.
Cela ne garantit pas des dialogues, une synchronisation sonore ou une musique exacts à chaque essai. Cela signifie que le modèle représente conjointement ces canaux de sortie.
Le checkpoint H3-Base FL2VA prend en charge zéro, une ou deux images d'entrée.
Ces modes vous permettent de partir d'une composition approuvée ou de définir les points finaux d'une transition. Ils ne garantissent pas que chaque image intermédiaire conservera tous les détails de la source.
Le checkpoint H3-Base Ref2VA accepte les images de référence, la vidéo et l'audio aux côtés du texte. Chaque source peut guider une partie différente du résultat demandé.
Par exemple, une image peut définir un personnage ou un produit. Une vidéo peut guider le mouvement ou la caméra. Un extrait audio peut orienter une voix, un rythme ou la relation entre les sons.
L’exemple officiel de MiniMax combine le mouvement de caméra d’une vidéo, un personnage issu d’une image et une voix provenant d’une source audio. Le modèle interprète leurs relations à l’aide du texte.
La fiche du modèle fixe des limites au nombre et à la durée des références. Elle précise également que l’audio de référence ne peut pas constituer la seule entrée multimédia dans les workflows Ref2VA locaux.
H3 génère actuellement des clips de 4 à 15 secondes. La fiche du modèle indique 24 i/s et un audio stéréo à 32 kHz.
H3-Base produit une sortie 768p. Le flux de travail 2K documenté de MiniMax combine H3-Base avec les API hébergées Context-IR et Regenerate-2K. L'API Video Generation V2 de bout en bout peut également renvoyer une sortie 2K.
La référence officielle de l’API Video Generation V2 reste la meilleure source pour consulter les options actuelles de requête et de sortie.
MiniMax affirme que ses premiers tests ont montré de bonnes performances en suivi d’instructions, rendu de texte et de marques, ainsi qu’en transfert de mouvement vidéo à vidéo. Il s’agit d’affirmations du fournisseur, et non de résultats indépendants de cet article.
Le système H3 complet se compose de trois parties. Leurs périmètres expliquent le workflow 2K et la publication des poids ouverts.
TEXTE + IMAGES + VIDÉO + AUDIO
│
▼
H3-Context-IR — interprétation hébergée du contexte
│
▼
H3-Base — poids publics, génération audiovisuelle en 768p
│
▼
H3-Regenerate-2K — régénération 2K contextuelle hébergée
Context-IR interprète la relation entre le média fourni et la sortie demandée. H3-Base génère ensuite une vidéo 768p et un audio stéréo. Regenerate-2K utilise ce résultat et le contexte d'origine pour créer la version à plus haute résolution.
MiniMax a publié les poids H3-Base FL2VA et Ref2VA. La publication actuelle des poids ouverts n’inclut ni Context-IR ni Regenerate-2K.
Pour le système H3 complet, « poids ouverts » est donc plus précis que « entièrement open source ». Les ressources téléchargeables sont régies par une licence communautaire MiniMax H3 personnalisée.
La prise en charge contextuelle étendue de H3 ne supprime pas les contraintes normales de la vidéo générée.
Premièrement, chaque sortie dure de 4 à 15 secondes. Une publicité, un film ou une histoire de produit plus longue nécessite toujours plusieurs plans et une chronologie de montage.
Deuxièmement, les contrôles dépendent de la surface d’accès. Une fonctionnalité de modèle en amont ne prouve pas que chaque application expose les mêmes rôles d’entrée, paramètres ou limites.
Troisièmement, les entrées de référence guident le résultat sans en garantir une copie exacte. Les mouvements complexes, les dialogues, les petits textes, les identités et les relations entre sources doivent toujours être vérifiés.
Enfin, MiniMax affirme que H3 peut encore s'améliorer en termes de compréhension multimodale, d'échelle de modèle et de détails visuels. Cette note apparaît dans la feuille de route de lancement de l'entreprise.
Considérez les exemples de lancement comme des démonstrations et non comme des garanties. Testez vos propres sujets, références, textes, dialogues et mouvements avant de choisir un flux de production.
MiniMax présente H3 comme un modèle pour la production audiovisuelle courte. Ses exemples officiels incluent des titres de films, des pages de produits, des affiches animées, de la publicité et du commerce électronique.
L’entreprise cite également le branding, la conception de produits, l’UI/UX et le jeu vidéo parmi les domaines visés. Ces catégories suggèrent plusieurs cas d’usage concrets.
H3 produit toujours de courts clips. Les histoires plus longues nécessitent une planification de prise de vue, une génération répétée, une révision et un montage.
La nomenclature est plus simple qu’elle n’en a l’air : MiniMax H3 désigne le modèle audiovisuel, MiniMax M3 le modèle de code et de tâches agentiques, Hailuo AI l’application destinée aux utilisateurs, et Hailuo 2.3 le modèle vidéo antérieur.
MiniMax H3 sera bientôt disponible dans DomoAI. Nous vous informerons dès sa mise en ligne.
Articles récents
© 2026 DOMOAI PET. LTD.
Accueil AI