
Table of Content

Try DomoAI, the Best AI Animation Generator
Turn any text, image, or video into anime, realistic, or artistic videos. Over 30 unique styles available.
MiniMax H3 ist das universelle omnimodale System von MiniMax zur Erzeugung von Videos mit nativem Stereo-Audio aus Text-, Bild-, Video- und Audiokontext. MiniMax M3 ist ein separates Modell für Programmierung und agentische Aufgaben. Hailuo AI ist eine nutzerorientierte Anwendung, während Hailuo 2.3 ein früheres Videomodell ist.
H3 ist erst seit Kurzem verfügbar. Daher können sich Zugangsdetails und implementierungsspezifische Steuerelemente noch ändern.
MiniMax veröffentlichte H3 am 31. Juli 2026. Das Unternehmen beschreibt es als universelles multimodales Generationsmodell. Die aktuelle Model Card verwendet den genaueren Begriff „omnimodales generatives System“.
Beide Beschreibungen meinen dasselbe: H3 kann mehrere Medientypen in einem gemeinsamen Kontext interpretieren und anschließend ein kurzes Video mit nativem Stereo-Audio erzeugen.
Die offizielle Veröffentlichung von MiniMax H3 und die H3 Model Card dokumentieren die folgenden aktuellen Spezifikationen:
| Merkmal | Aktuelle Spezifikation | Umfang |
|---|---|---|
| Offizieller Modellname | MiniMax H3 | MiniMax-Veröffentlichungsseite und Model Card |
| API-Modell-ID | MiniMax-H3 | Gehostete Video Generation V2-API |
| Kontexteingaben | Text, Bilder, Video und Audio | Die genauen Kombinationen hängen vom Modus und vom Zugangsweg ab |
| Dokumentierte Ausgabe | Video mit nativem Stereoton | Gehostete API und veröffentlichte H3-Base-Checkpoints |
| Dauer | 4–15 Sekunden | Spezifikation für Hosting und API |
| Bildrate | 24 fps | H3-Model Card |
| Audio | 32 kHz Stereo | H3-Model Card |
| Auflösung | H3-Base erzeugt 768p; über Regenerate-2K oder die End-to-End-API erreicht H3 bis zu 2K | Behandle die lokale H3-Base nicht als vollständiges 2K-System |
| Veröffentlichte Gewichte | H3-Base FL2VA und H3-Base Ref2VA | Open-Weights-Veröffentlichung unter einer benutzerdefinierten Lizenz |
„Omnimodal“ bedeutet nicht, dass jedes MiniMax-Produkt zu einem Endpunkt zusammengeführt wurde. Die dokumentierte H3-API und die freigegebenen Checkpoints konzentrieren sich auf die gemeinsame Video- und Audioausgabe.
Das Training von H3 umfasst weitere Aufgaben, daraus entstehen jedoch keine separaten öffentlichen H3-Produkte nur für Bilder, Musik oder Audio. Die aktuell verfügbaren Produktfunktionen sind aussagekräftiger als die Liste der Trainingsaufgaben.
Der einfachste Weg, diese Namen zu verstehen, besteht darin, Modelle von Produkten zu trennen. MiniMax ist das Unternehmen. H3 und M3 sind unterschiedliche Modelle. Hailuo AI ist eine kreative App, während Hailuo 2.3 ein spezielles Videomodell ist.
| Name | Was es ist | Hauptaufgabe | Hauptunterschied |
|---|---|---|---|
| MiniMax H3 | Universelles omnimodales Generationssystem | Video und natives Stereo-Audio aus multimodalem Kontext erzeugen | Offizielle API-ID: MiniMax-H3 |
| MiniMax M3 | Separates nativ multimodales Modell | Programmierung, agentische Aufgaben, Computernutzung und Aufgaben mit langem Kontext | Akzeptiert Bild- und Videoeingaben, seine offizielle Rolle unterscheidet sich jedoch von H3 |
| Hailuo AI | Benutzerorientierte MiniMax-Web-App | Bietet Erstellern eine Schnittstelle zur Mediengenerierung | MiniMax verlinkt sie als offizielle H3-App-Oberfläche |
| Hailuo 2.3 | Spezifisches MiniMax-Videomodell, veröffentlicht im Oktober 2025 | Videogenerierung | MiniMax beschrieb es als Weiterentwicklung von Hailuo 02 |
| „Hailuo H3“ oder „Hailuo 3.0“ | Begriffe aus Suche und Community | Hilft einigen Benutzern, die neue Version zu finden | MiniMax verwendet diese nicht als offiziellen Modellnamen des H3 |
Diese Unterscheidung verhindert zwei häufige Fehler. H3 ist nicht die Video-Edition von M3. Hailuo 2.3 ist kein weiterer offizieller Name für H3.
H3 und M3 verarbeiten beide mehr als einen Eingabetyp. Dieses gemeinsame Wort – multimodal – sorgt für große Verwirrung.
Der praktische Unterschied liegt in ihren Rollen und Ergebnissen.
| Dimension | MiniMax H3 | MiniMax M3 |
|---|---|---|
| Primäre Ausgabe | Kurzes Video mit nativem Stereoton | Antworten, Code, Schlussfolgerungen und Ergebnisse toolgestützter Aufgaben |
| Umfang der Hauptaufgabe | Ein 4–15 Sekunden langer Zielclip | Programmierung und agentische Aufgaben mit Kontextfenstern von bis zu einer Million Token |
| Typische Wahl | Generierte Szenen, Produktclips, Posteranimationen oder Referenzvideos | Code, Analyse, Computernutzung oder lang laufende Agentenaufgaben |
In der offiziellen M3-Veröffentlichung bezeichnet MiniMax M3 als nativ multimodal. Das Modell akzeptiert Bild- und Videoeingaben; eine Beschreibung als reines Textmodell wäre daher ungenau.
Diese Eingabeunterstützung macht M3 nicht zum H3-Video-Endpunkt. MiniMax positioniert M3 für Programmierung und agentische Aufgaben, H3 dagegen für audiovisuelle Generierung.
Betrachte ein Produkteinführungsprojekt. M3 könnte ein Design-Briefing prüfen, UI-Screenshots überprüfen, ein Repository analysieren oder bei der Koordinierung von Aufgaben helfen. H3 könnte Produktbilder, Bewegungsreferenzen und Audioregie verwenden, um einen kurzen Clip zu erstellen.
Die Modelle können dasselbe umfassendere Projekt unterstützen, erfüllen aber nicht dieselbe Rolle.
Hailuo erscheint sowohl in der Produkt- als auch in der Modellbezeichnung. Das macht die Beziehung weniger offensichtlich als die Unterscheidung zwischen H3 und M3.
MiniMax verlinkt Hailuo AI im Abschnitt „Online-App“ des H3-Repositorys. Es handelt sich um eine Produktoberfläche, über die Benutzer auf die Funktionen zur Mediengenerierung von MiniMax zugreifen können.
Dadurch wird Hailuo nicht zum offiziellen API-Namen jedes zugrunde liegenden Modells. Produkt- und Modellnamen können nebeneinander bestehen.
MiniMax kündigte Hailuo 2.3 am 28. Oktober 2025 an. In der offiziellen Version von Hailuo 2.3 heißt es, dass es auf Hailuo 02 basiert.
MiniMax stellte bei diesem Update physische Bewegung, Stilisierung, Mikroausdrücke von Figuren und die Umsetzung von Bewegungsanweisungen in den Mittelpunkt. Diese Angaben stammen aus dem eigenen Einführungsmaterial von MiniMax.
Hailuo 2.3 und H3 haben separate offizielle Namen und Release-Seiten. Aus den verfügbaren Quellen geht nicht hervor, dass H3 Hailuo 2.3 umbenannt oder direkt ersetzt hat.
Einige Seiten und Benutzer von Drittanbietern nennen das neue Modell „Hailuo H3“, „Hailuo 3.0“ oder „Hailuo 03“. Diese Begriffe können dabei helfen, die Suchabsicht zu identifizieren, sie sollten jedoch nicht das Produkt definieren.
Mit Stand vom 7. August 2026 verwenden die Veröffentlichungsseite und die Model Card von MiniMax im Fließtext den Namen „MiniMax H3“. Die Video Generation V2 API erfordert die Modell-ID MiniMax-H3.
H3 unterstützt mehrere Eingabemuster innerhalb eines Video-Generationssystems. Welches Muster passt, hängt davon ab, ob du mit einer Idee, einem Frame oder mehreren Referenzmedien beginnst.
Bei Text-to-Video beschreibst du Motive, Handlung, Umgebung, Kameraverhalten, Dialog, Soundeffekte, Atmosphäre und Musik. H3 erzeugt Bild- und Tonspur gemeinsam.
Das unterscheidet sich von Workflows, die zunächst einen stummen Clip erzeugen, und vom nachträglichen Hinzufügen von Stock-Audio. Mit nativem Audio kann das Modell sichtbare Handlung und Ton als Teile derselben Zielsequenz behandeln.
Dies garantiert nicht bei jedem Versuch einen korrekten Dialog, Ton-Timing oder Musik. Das bedeutet, dass das Modell diese Ausgabekanäle gemeinsam darstellt.
Der H3-Base FL2VA-Checkpoint unterstützt null, ein oder zwei Eingabebilder.
Mit diesen Modi kannst du von einer freigegebenen Komposition ausgehen oder die Endpunkte eines Übergangs festlegen. Sie garantieren nicht, dass jedes Zwischenbild alle Details der Quellen bewahrt.
Der H3-Base Ref2VA-Checkpoint akzeptiert neben Text auch Referenzbilder, Videos und Audio. Jede Quelle kann einen anderen Teil des angeforderten Ergebnisses steuern.
Beispielsweise kann ein Bild eine Figur oder ein Produkt darstellen. Ein Video kann Bewegung oder Kameraverhalten steuern. Ein Audioclip kann eine Stimme, einen Rhythmus oder eine Klangbeziehung leiten.
Das offizielle Beispiel von MiniMax kombiniert die Kamerabewegung aus einem Video, eine Figur aus einem Bild und Gesang aus einer Audioquelle. Das Modell interpretiert ihre Beziehungen anhand des Textes.
Die Model Card begrenzt Anzahl und Dauer der Referenzen. Außerdem darf Referenzaudio in lokalen Ref2VA-Workflows nicht die einzige Medieneingabe sein.
H3 produziert derzeit Clips mit einer Länge von 4 bis 15 Sekunden. Die Model Card dokumentiert 24 fps und 32 kHz Stereoton.
H3-Base erzeugt eine 768p-Ausgabe. Der dokumentierte 2K-Workflow von MiniMax kombiniert H3-Base mit gehosteten Context-IR- und Regenerate-2K-APIs. Die End-to-End-Video Generation V2-API kann auch eine 2K-Ausgabe zurückgeben.
Die offizielle Referenz der Video Generation V2 API ist weiterhin die beste Quelle für aktuelle Anfrage- und Ausgabeoptionen.
Laut MiniMax zeigten erste Tests eine gute Befolgung von Anweisungen, Text- und Markenwiedergabe sowie Video-zu-Video-Bewegungsübertragung. Dabei handelt es sich um Angaben des Anbieters, nicht um unabhängige Ergebnisse dieses Artikels.
Das vollständige H3-System besteht aus drei Teilen. Ihre Abgrenzung erklärt den 2K-Workflow und den Umfang der Open-Weights-Veröffentlichung.
TEXT + BILDER + VIDEO + AUDIO
│
▼
H3-Context-IR — gehostete Kontextinterpretation
│
▼
H3-Base — öffentliche Gewichte, audiovisuelle 768p-Generierung
│
▼
H3-Regenerate-2K — gehostete kontextbezogene 2K-Regenerierung
Context-IR interpretiert, wie sich die bereitgestellten Medien auf die angeforderte Ausgabe beziehen. H3-Base generiert dann 768p-Video und Stereo-Audio. Regenerate-2K verwendet dieses Ergebnis und den ursprünglichen Kontext, um die Version mit höherer Auflösung zu erstellen.
MiniMax veröffentlichte die Gewichte H3-Base FL2VA und Ref2VA. Context-IR und Regenerate-2K sind in der aktuellen Open-Weights-Veröffentlichung nicht enthalten.
Für das vollständige H3-System ist „Open Weights“ daher präziser als „vollständig Open Source“. Für die herunterladbaren Materialien gilt eine benutzerdefinierte MiniMax H3 Community License.
Die umfassende Kontextunterstützung von H3 beseitigt nicht die normalen Einschränkungen generierter Videos.
Zunächst dauert jede Ausgabe 4 bis 15 Sekunden. Für eine längere Anzeige, einen längeren Film oder eine längere Produktgeschichte sind immer noch mehrere Aufnahmen und ein Bearbeitungszeitplan erforderlich.
Zweitens hängen die Steuerelemente vom Zugangsweg ab. Eine Fähigkeit des zugrunde liegenden Modells beweist nicht, dass jede App dieselben Eingaberollen, Einstellungen oder Grenzen anbietet.
Drittens dienen Referenzeingaben als Anleitung und garantieren keine exakte Kopie. Komplexe Bewegungen, Dialoge, kleine Texte, Identitäten und Beziehungen zwischen Quellen müssen weiterhin geprüft werden.
Abschließend sagt MiniMax, dass H3 hinsichtlich des multimodalen Verständnisses, des Modellmaßstabs und der visuellen Details noch Raum für Verbesserungen bietet. Dieser Hinweis erscheint in der unternehmenseigenen Start-Roadmap.
Betrachte Einführungsbeispiele als Demonstrationen und nicht als Garantien. Teste deine eigenen Themen, Referenzen, Texte, Dialoge und Bewegungen, bevor du dich für einen Produktionsworkflow entscheidest.
MiniMax präsentiert H3 als Modell für die audiovisuelle Kurzformproduktion. Zu den offiziellen Beispielen gehören Filmtitel, Produktseiten, animierte Poster, Werbung und E-Commerce.
Das Unternehmen nennt außerdem Branding, Produktdesign, UI/UX und Gaming als Zielbereiche. Daraus ergeben sich mehrere praktische Einsatzmöglichkeiten.
H3 erzeugt weiterhin kurze Clips. Längere Geschichten erfordern Shot-Planung, wiederholte Generierung, Prüfung und Schnitt.
Die Benennung ist einfacher, als es zunächst scheint: Verwende MiniMax H3 für das audiovisuelle Modell, MiniMax M3 für Codierung und Agentenarbeit, Hailuo AI für das benutzerorientierte Produkt und Hailuo 2.3 für das frühere Videomodell.
MiniMax H3 erscheint demnächst in DomoAI. Wir werden die Neuigkeiten teilen, sobald sie live sind – bleib dran.
Recent articles
© 2026 DOMOAI PET. GMBH
nach Moai