
Table of Content

Try DomoAI, the Best AI Animation Generator
Turn any text, image, or video into anime, realistic, or artistic videos. Over 30 unique styles available.
MiniMax H3는 텍스트, 이미지, 비디오, 오디오 컨텍스트를 바탕으로 네이티브 스테레오 오디오가 포함된 비디오를 생성하는 MiniMax의 범용 옴니모달 시스템입니다. MiniMax M3는 코딩과 에이전트 작업을 위한 별도 모델입니다. Hailuo AI는 사용자용 제품이며, Hailuo 2.3은 이전 세대 비디오 모델입니다.
H3는 출시된 지 얼마 되지 않아 접근 방식과 구현별 제어 옵션이 변경될 수 있습니다.
MiniMax는 2026년 7월 31일 H3를 출시했습니다. 회사는 H3를 범용 멀티모달 생성 모델로 설명하며, 현재 모델 카드에서는 더 구체적으로 ‘옴니모달 생성 시스템’이라는 표현을 사용합니다.
두 설명 모두 동일한 아이디어를 나타냅니다. H3는 하나의 컨텍스트 내에서 여러 미디어 유형을 해석할 수 있습니다. 그런 다음 짧은 비디오와 네이티브 스테레오 오디오를 함께 생성합니다.
MiniMax H3 공식 출시 자료와 H3 모델 카드에는 다음과 같은 최신 사양이 명시되어 있습니다.
| 항목 | 현재 사양 | 범위 |
|---|---|---|
| 공식 모델명 | MiniMax H3 | MiniMax 출시 페이지 및 모델 카드 |
| API 모델 ID | MiniMax-H3 | 호스팅형 Video Generation V2 API |
| 컨텍스트 입력 | 텍스트, 이미지, 비디오, 오디오 | 정확한 조합은 모드와 접근 방식에 따라 달라집니다. |
| 문서화된 출력 | 네이티브 스테레오 오디오가 포함된 비디오 | 호스팅된 API 및 출시된 H3-Base 체크포인트 |
| 기간 | 4~15초 | 호스팅/API 사양 |
| 프레임 속도 | 24fps | H3 모델 카드 |
| 오디오 | 32kHz 스테레오 | H3 모델 카드 |
| 해상도 | H3-Base는 768p에서 생성됩니다. H3는 Regenerate-2K 또는 엔드투엔드 API를 통해 최대 2K에 도달합니다. | 로컬 H3-Base를 완전한 2K 시스템으로 간주해서는 안 됩니다. |
| 공개 가중치 | H3-Base FL2VA 및 H3-Base Ref2VA | 맞춤형 라이선스에 따른 오픈 웨이트 릴리스 |
"옴니모달"은 모든 MiniMax 제품이 하나의 엔드포인트로 병합되었음을 의미하지 않습니다. 문서화된 H3 API와 공개된 체크포인트는 공동 비디오 및 오디오 출력에 중점을 둡니다.
H3의 학습에는 더 폭넓은 작업이 포함되지만, 그렇다고 이미지 전용·음악 전용·오디오 전용 H3 제품이 별도로 공개된 것은 아닙니다. 학습 작업 목록보다 현재 제공되는 제품 기능을 기준으로 판단해야 합니다.
이 이름들을 이해하려면 모델과 제품을 구분하는 것이 가장 쉽습니다. MiniMax는 회사명이고 H3와 M3는 서로 다른 모델입니다. Hailuo AI는 크리에이티브 앱이며 Hailuo 2.3은 특정 비디오 모델입니다.
| 이름 | 구분 | 주요 역할 | 주요 차이점 |
|---|---|---|---|
| MiniMax H3 | 범용 옴니모달 생성 시스템 | 다중 모드 컨텍스트에서 비디오 및 네이티브 스테레오 오디오 생성 | 공식 API ID: MiniMax-H3 |
| MiniMax M3 | 별도의 네이티브 멀티모달 모델 | 코딩, 에이전트 작업, 컴퓨터 사용, 장문 컨텍스트 작업 | 이미지 및 비디오 입력을 허용하지만 공식적인 역할은 H3와 다릅니다. |
| Hailuo AI | 사용자 지향 MiniMax 웹 앱 | 제작자에게 미디어 생성을 위한 인터페이스 제공 | MiniMax가 공식 H3 앱 인터페이스로 연결 |
| Hailuo 2.3 | 2025년 10월 출시된 특정 MiniMax 영상 모델 | 비디오 생성 | MiniMax는 이를 Hailuo 02를 기반으로 구축한 것으로 설명했습니다. |
| “Hailuo H3” 또는 “Hailuo 3.0” | 검색 및 커뮤니티 표현 | 일부 사용자가 새 릴리스를 찾는 데 도움이 됩니다. | MiniMax는 이를 H3의 공식 모델명으로 사용하지 않습니다. |
이러한 구별은 두 가지 일반적인 실수를 방지합니다. H3는 M3의 비디오 에디션이 아닙니다. Hailuo 2.3은 H3의 또 다른 공식 이름이 아닙니다.
H3와 M3는 모두 여러 입력 유형을 처리합니다. 둘 다 ‘멀티모달’이라는 표현을 사용하기 때문에 혼동하기 쉽습니다.
실질적인 차이는 각 모델의 역할과 출력에 있습니다.
| 차원 | MiniMax H3 | MiniMax M3 |
|---|---|---|
| 주요 출력 | 네이티브 스테레오 오디오가 포함된 짧은 비디오 | 응답, 코드, 추론 및 도구 기반 작업 결과 |
| 주요 작업 범위 | 4~15초짜리 타겟 클립 | 최대 100만 토큰의 컨텍스트 창을 활용하는 코딩 및 에이전트 작업 |
| 일반적인 선택 | 생성된 장면, 제품 클립, 포스터 애니메이션 또는 참조 주도 비디오 | 코드, 분석, 컴퓨터 사용 또는 장기 실행 에이전트 작업 |
MiniMax는 M3 공식 출시 자료에서 M3를 네이티브 멀티모달 모델로 설명합니다. M3는 이미지와 비디오 입력을 지원하므로 텍스트 전용 모델로 소개하면 부정확합니다.
이러한 입력 지원이 M3를 H3 비디오 엔드포인트로 바꾸는 것은 아닙니다. MiniMax는 M3를 코딩과 에이전트 작업에, H3를 시청각 생성에 맞춰 제공하고 있습니다.
제품 출시 프로젝트를 생각해 보세요. M3는 디자인 개요를 검사하고, UI 스크린샷을 검토하고, 저장소를 분석하고, 작업 조정을 도울 수 있습니다. H3는 제품 이미지, 모션 참조 및 오디오 방향을 사용하여 짧은 클립을 생성할 수 있습니다.
두 모델은 같은 대규모 프로젝트에 함께 활용할 수 있지만 역할은 서로 다릅니다.
Hailuo라는 이름이 제품명과 모델명에 모두 쓰이기 때문에 H3와 M3의 차이보다 관계가 덜 명확하게 느껴질 수 있습니다.
MiniMax는 H3 저장소의 ‘Online App’ 섹션에 Hailuo AI를 연결해 두었습니다. 사용자가 MiniMax의 미디어 생성 기능을 이용할 수 있는 제품 인터페이스입니다.
그렇다고 Hailuo가 모든 기반 모델의 공식 API 이름인 것은 아닙니다. 제품명과 모델명은 별도로 존재할 수 있습니다.
MiniMax는 2025년 10월 28일에 Hailuo 2.3을 발표했습니다. 공식 Hailuo 2.3 릴리스에는 Hailuo 02를 기반으로 구축되었다고 나와 있습니다.
MiniMax는 물리적 움직임, 스타일 표현, 캐릭터의 미세 표정, 모션 명령 반응을 중심으로 Hailuo 2.3 업데이트를 소개했습니다. 이는 MiniMax의 공식 출시 자료에 나온 설명입니다.
Hailuo 2.3과 H3에는 별도의 공식 이름과 릴리스 페이지가 있습니다. 사용 가능한 소스에서는 H3가 Hailuo 2.3의 이름을 바꾸거나 직접 대체했다고 말하지 않습니다.
일부 타사 페이지와 사용자는 새 모델을 "Hailuo H3", "Hailuo 3.0" 또는 "Hailuo 03"이라고 부릅니다. 이러한 용어는 검색 의도를 식별하는 데 도움이 될 수 있지만 제품을 정의해서는 안 됩니다.
2026년 8월 7일 기준 MiniMax의 출시 페이지와 모델 카드는 본문에서 ‘MiniMax H3’라는 이름을 사용합니다. Video Generation V2 API에는 모델 ID MiniMax-H3가 필요합니다.
H3는 하나의 비디오 생성 시스템에서 여러 입력 방식을 지원합니다. 아이디어, 프레임 또는 여러 참조 자료 중 무엇으로 시작하는지에 따라 적합한 방식이 달라집니다.
텍스트 투 비디오에서는 피사체, 동작, 배경, 카메라 움직임, 대사, 효과음, 분위기, 음악을 설명합니다. H3는 영상과 오디오 트랙을 함께 생성합니다.
이는 무음 클립을 먼저 생성하는 작업 흐름과 다릅니다. 생성 후 스톡 오디오를 추가하는 것과도 다릅니다. 네이티브 오디오를 사용하면 모델이 눈에 보이는 동작과 사운드를 하나의 대상 시퀀스의 일부로 처리할 수 있습니다.
이 기능이 매번 정확한 대사, 사운드 타이밍 또는 음악을 보장하는 것은 아닙니다. 다만 모델이 이러한 출력 채널을 함께 처리한다는 의미입니다.
H3-Base FL2VA 체크포인트는 0개, 1개 또는 2개의 입력 이미지를 지원합니다.
이러한 모드를 사용하면 승인된 구성에서 시작하거나 전환의 끝점을 정의할 수 있습니다. 모든 중간 프레임이 모든 소스 세부 정보를 유지한다는 보장은 없습니다.
H3-Base Ref2VA 체크포인트는 텍스트와 함께 참조 이미지, 비디오, 오디오를 입력받습니다. 각 소스는 요청한 결과의 서로 다른 요소를 안내할 수 있습니다.
예를 들어 이미지는 캐릭터나 제품을 정의하고, 비디오는 움직임이나 카메라 동작을 안내하며, 오디오 클립은 음성·리듬·사운드 관계를 안내할 수 있습니다.
MiniMax의 공식 예시는 한 비디오의 카메라 움직임, 한 이미지의 캐릭터, 한 오디오 소스의 보컬을 결합합니다. 모델은 텍스트를 통해 이들 사이의 관계를 해석합니다.
모델 카드는 참조 자료의 수와 길이에 제한을 둡니다. 또한 로컬 Ref2VA 워크플로에서는 참조 오디오만 단독 미디어 입력으로 사용할 수 없다고 명시합니다.
H3는 현재 4~15초 길이의 클립을 생성합니다. 모델 카드에는 24fps와 32kHz 스테레오 오디오가 명시되어 있습니다.
H3-Base는 768p 출력을 생성합니다. MiniMax의 문서화된 2K 워크플로는 H3-Base를 호스팅된 Context-IR 및 Regenerate-2K API와 결합합니다. 엔드투엔드 Video Generation V2 API는 2K 출력도 반환할 수 있습니다.
현재 요청 및 출력 옵션은 공식 Video Generation V2 API 레퍼런스에서 확인하는 것이 가장 정확합니다.
MiniMax는 초기 테스트에서 지시 이행, 텍스트 및 브랜드 렌더링, 비디오 간 모션 전송이 우수했다고 밝혔습니다. 이는 공급업체의 주장으로, 이 글에서 독립적으로 검증한 결과는 아닙니다.
전체 H3 시스템은 세 부분으로 구성됩니다. 각 부분의 경계를 이해하면 2K 워크플로와 오픈 웨이트 공개 범위를 파악할 수 있습니다.
텍스트 + 이미지 + 비디오 + 오디오
│
▼
H3-Context-IR — 호스팅 방식의 컨텍스트 해석
│
▼
H3-Base — 공개 가중치, 768p 시청각 생성
│
▼
H3-Regenerate-2K — 호스팅 방식, 컨텍스트 기반 2K 재생성
Context-IR은 제공된 미디어가 요청된 출력과 어떻게 관련되는지 해석합니다. 그런 다음 H3-Base는 768p 비디오 및 스테레오 오디오를 생성합니다. Regenerate-2K는 해당 결과와 원래 컨텍스트를 사용하여 고해상도 버전을 만듭니다.
MiniMax는 H3-Base FL2VA 및 Ref2VA 가중치를 발표했습니다. 현재 공개 가중치 릴리스에는 Context-IR 또는 Regenerate-2K가 포함되지 않았습니다.
따라서 전체 H3 시스템을 설명할 때는 ‘완전한 오픈 소스’보다 ‘오픈 웨이트’가 더 정확합니다. 다운로드 자료에는 MiniMax H3 커뮤니티 라이선스가 적용됩니다.
H3의 광범위한 컨텍스트 지원은 생성된 비디오의 일반적인 제약을 제거하지 않습니다.
첫째, 각 출력은 4~15초입니다. 더 긴 광고, 영화 또는 제품 스토리를 만들려면 여러 샷과 편집 타임라인이 필요합니다.
둘째, 제어 옵션은 접근 방식에 따라 달라집니다. 기반 모델의 기능이 모든 앱에서 동일한 입력 역할, 설정 또는 제한으로 제공된다는 뜻은 아닙니다.
셋째, 참조 입력은 결과를 안내할 뿐 정확한 복사를 보장하지 않습니다. 복잡한 움직임, 대사, 작은 글자, 인물 정체성, 소스 간 관계는 반드시 검토해야 합니다.
마지막으로 MiniMax는 H3의 멀티모달 이해, 모델 규모, 시각적 세부 표현에 개선 여지가 있다고 밝혔습니다. 이 내용은 회사의 출시 로드맵에 포함되어 있습니다.
출시 사례를 보장이 아닌 데모로 간주하세요. 제작 작업 흐름을 선택하기 전에 주제, 참조, 텍스트, 대화 및 모션을 테스트해 보세요.
MiniMax는 H3를 짧은 시청각 콘텐츠 제작용 모델로 소개합니다. 공식 예시에는 영화 타이틀, 제품 페이지, 애니메이션 포스터, 광고, 이커머스가 포함됩니다.
회사는 브랜딩, 제품 디자인, UI/UX, 게임도 주요 영역으로 제시합니다. 이를 바탕으로 다음과 같은 실용적인 활용 사례를 생각할 수 있습니다.
H3은 여전히 짧은 클립을 생성합니다. 긴 스토리에는 장면 계획, 반복 생성, 검토 및 편집이 필요합니다.
이름은 처음 보이는 것보다 간단합니다. 시청각 모델에는 MiniMax H3, 코딩 및 에이전트 작업에는 MiniMax M3, 사용자 대상 제품에는 Hailuo AI, 이전 비디오 모델에는 Hailuo 2.3을 사용합니다.
MiniMax H3는 곧 DomoAI에 추가될 예정입니다. 제공이 시작되면 소식을 알려드리겠습니다.
Recent articles
© 2026 도모아이 페트.주식회사
도모아이