
Table of Content

Try DomoAI, the Best AI Animation Generator
Turn any text, image, or video into anime, realistic, or artistic videos. Over 30 unique styles available.
MiniMax H3의 레퍼런스 투 비디오는 각 소스의 역할을 명확히 지정할 때 가장 효과적입니다. 외관이나 구도에는 이미지를, 움직임이나 카메라에는 비디오를, 소리 신호에는 오디오를 사용합니다. 그런 다음 H3가 유지하거나 반영하거나 변경할 요소와 약하게 참고할 요소를 구분해 작성합니다.
하나의 자산에서 여러 피사체나 속성을 가져올 수 있습니다. ‘소스당 하나의 주요 역할’ 규칙은 각 소스의 핵심 책임을 정하는 계획 방법이며, 자산 하나만 사용할 수 있다는 기술적 제한이 아닙니다.
레퍼런스 투 비디오, 즉 Ref2VA는 텍스트와 참조 이미지·비디오·오디오를 함께 사용해 새로운 시청각 클립을 만듭니다. 각 소스는 정체성, 외관, 스타일, 움직임, 카메라, 타이밍, 음성, 음향 효과 또는 음악을 안내할 수 있습니다.
H3는 모든 파일을 프레임으로 취급하지 않습니다. 이미지는 외관을 정의하고, 비디오는 카메라를 안내하며, 오디오는 음색을 안내할 수 있습니다.
MiniMax의 공식 전체 참조 프롬프트 가이드는 라벨, 보존 표시, 6개 섹션으로 구성된 계획 형식으로 이러한 관계를 정의합니다.
이 형식은 의도한 관계를 설명하지만 정체성의 완전한 유지, 물리적 동작, 립싱크, 타이밍, 텍스트 또는 픽셀 단위 재현을 보장하지 않습니다.
입력 이미지를 첫 프레임, 마지막 프레임 또는 둘 다에 고정해야 한다면 FL2VA를 선택합니다. 소스를 고정된 시작점이나 끝점이 아니라 속성 또는 동작의 가이드로 사용하려면 Ref2VA를 선택합니다.
| 목적 | 권장 H3 모드 | 이유 |
|---|---|---|
| 하나의 오프닝 이미지에서 시작 | 첫 번째 프레임 I2VA 모드의 FL2VA 체크포인트 | 입력 이미지가 시작 상태를 고정합니다 |
| 지정한 종료 이미지에 도달 | L2VA 모드의 FL2VA 체크포인트 | 프롬프트가 최종 상태까지의 변화를 설명합니다 |
| 첫 번째 이미지와 마지막 이미지 모두 제한 | 첫 번째 및 마지막 프레임 모드의 FL2VA 체크포인트 | 두 끝점 모두 명시적입니다. |
| 여러 소스에서 정체성, 스타일, 움직임, 카메라 또는 사운드 참조 | Ref2VA | 소스마다 서로 다른 참조 역할을 지정할 수 있습니다 |
| 한 요청에서 첫/마지막 프레임 API 역할과 참조 역할을 함께 사용 | 단일 API 요청에서는 지원하지 않음 | 공식 API는 이러한 역할군을 상호 배타적으로 취급합니다. |
Video Generation V2 API 참조에서는 시작·종료 프레임 역할과 참조 미디어 역할을 구분합니다. 하나의 API 요청에서 두 역할군을 함께 사용할 수 없습니다.
모든 참조는 H3가 해석해야 하는 또 다른 관계를 추가합니다.
업로드하기 전에 다음 5가지 확인 필터를 사용하세요.
깔끔한 제품 사진은 복잡한 콜라주보다 제품 형태를 더 안정적으로 안내합니다. 안정적인 움직임 클립은 빠른 몽타주보다 카메라 의도를 더 잘 전달합니다.
참조 자료를 모으기 전에 샷을 계획하세요. 이 AI 스토리보드 가이드를 활용하면 애니메이션 전에 구도, 동작, 카메라 결정을 나눠 정리할 수 있습니다.
MiniMax의 현재 H3 저장소 및 모델 문서에는 다음과 같은 로컬 Ref2VA 제한이 나열되어 있습니다.
호스팅된 API에는 모든 요청에 비어 있지 않은 텍스트 프롬프트가 필요합니다. 현재 요청 본문 제한은 64MB입니다.
API 참조 이미지는 JPG, JPEG, PNG, WEBP, HEIC 또는 HEIF를 사용할 수 있습니다. 참조 비디오는 MP4 또는 MOV를 허용하고 참조 오디오는 WAV 또는 MP3를 허용합니다.
API 업로드 요구 사항은 변경될 수 있으므로 요청을 제출하기 전에 현재 Video Generation V2 API 참조를 확인하세요.
MiniMax는 ComfyUI를 하나의 로컬 추론 옵션으로 나열합니다. 로컬 입력 규칙과 호스팅된 API 요청 규칙은 다를 수 있습니다.
프롬프트를 작성하기 전에 참조 역할 시트를 만드세요. 각 파일에 하나의 주요 역할을 지정하고, 필요하면 보조 역할도 하나 추가합니다.
| 소스 또는 라벨 | 적합한 주요 역할 | 보증하지 않는 것 |
|---|---|---|
<Subject N> | 재사용 가능한 사람, 개체, 환경, 동작, 포즈, 효과 또는 소스에서 추상화된 스타일 | 정체성의 완벽한 고정 또는 별도로 업로드한 파일과의 동일성 |
<Picture N> | 구체적인 프레임, 구성, 스토리보드 앵커, 공간 배치 또는 조명 앵커 | 완전한 움직임, 시간적 구조 또는 완벽한 기하학 유지 |
<Video N> | 소스 편집, 연속, 모션 패턴, 카메라 경로, 컷, 리듬 또는 시간 구조 | 교체, 정확한 물리 동작 또는 픽셀 단위 복사 보장 |
<Audio N> | 음성 음색, 비트, 대화 신호, 음향 효과, 음악 특성, 연속성 또는 직접적인 오디오 재사용 | 립싱크 보장 또는 오디오만 사용하는 로컬 Ref2VA 입력 |
워크시트 형식은 다음과 같습니다.
| 자산 ID | 유형 | 권리를 확보했나요? | 주요 역할 | 보조 역할 | 유지·반영·변경 | 적용 샷 | 충돌 또는 검수 기준 |
|---|---|---|---|---|---|---|---|
| Picture 1 | 이미지 | 예 | 병 모양 및 라벨 | 소재 색상 | 기하학과 무광 검정색 캡을 유지합니다. | 모든 샷 | 라벨은 앞쪽을 향하게 유지됩니다. |
| Picture 2 | 이미지 | 예 | 온실 환경 | 새벽 팔레트 | 소품은 제외하고 환경만 반영 | 모든 샷 | 두 번째 제품이 표시되지 않습니다. |
| Video 1 | 비디오 | 예 | 시계 방향 카메라 호 | 느린 속도 | 카메라 경로만 반영 | 샷 1 | 병은 소스 모양을 상속하지 않습니다. |
| Audio 1 | 오디오 | 예 | 유리 차임 텍스처 | 마지막 효과음의 타이밍 | 음색만 참고하고 원본 신호는 복사하지 않음 | 샷 2 | 캡 클릭 후 깨끗한 차임벨 한 번 |
검수 기준을 정하면 각 역할이 제대로 반영됐는지 따로 확인할 수 있습니다.
제품 영상에는 제품 영상 일관성 가이드를 참고해 형태와 라벨 검수 항목을 추가하세요.
이 지시에는 우선순위가 정해져 있지 않습니다.
Use the silver cap from Picture 1 and the black cap from Picture 2. Keep both exact.
이 버전에서는 다음과 같이 역할을 명확히 지정합니다.
Picture 1 controls the bottle geometry, amber glass, matte-black cap, and label. Picture 2 controls only the greenhouse environment and dawn lighting; ignore the container shown in Picture 2.
참조 동작이 출연자보다 중요하다면 범위를 분명히 적으세요. Video 1은 움직임과 카메라만 제어하며, 출연자와 배경은 참조하지 않는다고 지정합니다.
6개 섹션 전체에서 같은 라벨 번호를 유지하세요.
<Subject N>은 사람, 제품, 환경, 동작, 포즈, 인터페이스 또는 스타일과 같이 재사용 가능하거나 편집 가능한 시각적 콘텐츠를 의미합니다.
<Subject 1> is the square amber-glass perfume bottle whose geometry, matte-black cap, and cream "NORTHLINE" label come from <Picture 1>.
이미지를 구체적인 프레임이나 구도 기준으로 쓸 때는 <Picture N>을 단독으로 사용합니다.
<Picture 3> is the first-frame composition anchor for [Shot 1], defining the bottle position, plinth angle, and empty space on the right.
이미지가 Subject만 정의한다면 해당 Subject 정의 안에서 이미지를 인용하세요.
<Video N>은 소스 편집, 이어 만들기, 카메라, 컷, 리듬 또는 시간 구조에 사용합니다. 추출된 사람과 개체에는 여전히 Subject 라벨이 필요합니다.
<Audio N>은 음성, 타이밍, 비트, 효과 또는 음악 특성을 직접 재사용하거나 참고할 때 사용합니다. 오디오 및 비디오 번호는 독립적으로 유지됩니다.
MiniMax의 전체 참조 가이드는 다음 순서로 6개 섹션을 사용합니다.
subject_definitionssummaryretention_analysisdetailed_descriptionoverall_soundscapenon_diegetic_music호스팅된 API에는 텍스트가 필요하지만 모든 사용자가 전체 형식을 직접 작성할 필요는 없습니다. H3-Context-IR은 자유 형식 멀티모달 입력을 처리할 수 있습니다. 필수 API 원시 스키마가 아니라 정밀한 계획 언어로 6개 섹션을 사용하세요.
아래의 직접 작성한 예시는 MiniMax가 문서화한 형식을 가상의 제품 샷에 적용한 것입니다.
실행 카드 예시: Ref2VA · 8초 · 16:9 · 이미지 3개 · 비디오 1개 · 오디오 참조 1개.
subject_definitions:
<Subject 1> is the square amber-glass perfume bottle whose geometry, matte-black cap, and cream "NORTHLINE" label come from <Picture 1>.
<Subject 2> is the greenhouse environment from <Picture 2>, with wet black-basalt surfaces, tall fern leaves, glass roof panels, and cold blue dawn light.
<Picture 3> is the first-frame composition anchor for [Shot 1], defining the bottle position, plinth angle, and empty space on the right.
<Video 1> provides the slow clockwise camera arc and measured pacing for [Shot 1], without providing product appearance.
<Audio 1> is the sound-texture reference for one clear glass chime heard after the cap click in [Shot 2].
summary:
[keyframe completion + reference generation + audio reference] The target video presents <Subject 1> inside <Subject 2>. It begins from the composition in <Picture 3>, follows the camera path from <Video 1>, and uses <Audio 1> only as a sound-texture reference for the final chime.
retention_analysis:
<Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved - the square amber-glass body, matte-black cap, cream "NORTHLINE" label, and front-facing product identity are retained.
<Subject 2> (appears in [Shot 1], [Shot 2]): fully_preserved - the wet basalt, fern leaves, glass roof, and cold blue dawn lighting are retained.
<Picture 3> ([Shot 1] first frame): fully_preserved - the opening bottle position, plinth angle, and right-side negative space are retained.
<Video 1> (camera path and pacing): partially_preserved - its slow clockwise arc and measured speed guide [Shot 1], while its source subjects and setting are excluded.
<Audio 1>: reference - its clean glass-chime texture guides one newly generated accent without copying the original signal.
detailed_description:
The target video uses a live-action cinematic product-film style with restrained movement and cool dawn lighting.
[Shot 1] The shot begins from <Picture 3>. <Subject 1>, the square amber-glass perfume bottle with a matte-black cap and cream "NORTHLINE" label, stands on the wet basalt plinth inside <Subject 2>. The camera follows the slow clockwise arc and measured pacing referenced from <Video 1>. Cold blue light enters from the right through the greenhouse roof. Water beads slide down the amber glass. Fern leaves move slightly behind the product. The bottle stays fixed, front-facing, and unchanged while the camera completes the arc. No second bottle, subtitle, or watermark appears.
[Shot 2] At 00:05.000, the camera cuts to a static close-up of <Subject 1>. A clean hand enters from the upper right, presses the matte-black cap down once, and releases it. The cap makes a dry click. A single newly generated glass chime follows, using the clear texture referenced from <Audio 1> without copying its signal. A narrow amber reflection crosses the cream "NORTHLINE" label from left to right. The hand exits. The bottle remains centered and readable through the final frame.
overall_soundscape:
Light rain taps on the glass roof throughout the video. Fern leaves brush softly in the background, while water drops strike the basalt and the cap produces one dry mechanical click.
non_diegetic_music:
N/A
계획에는 각 소스가 제어하고 제외하는 것이 명시되어 있습니다.
참조는 클립의 일부에만 중요할 수 있으므로 샷별로 역할을 할당하세요.
각 샷은 다음 순서로 작성하세요.
첫 번째 샷에는 타임스탬프를 쓰지 않습니다. 이후 샷에는 [Shot N] At MM:SS.mmm, ... 형식으로 컷 시간을 오름차순으로 지정합니다. 비디오 두 개로 움직임을 안내한다면 하나는 신체 동작에, 다른 하나는 카메라에 할당합니다.
의도한 신호 관계와 일치하는 오디오 마커를 선택합니다.
| 마커 | 쉽게 풀어쓴 의미 |
|---|---|
fully_copy | 전체 소스 오디오를 완전한 최종 오디오 트랙으로 재사용 |
partially_copy | 타임라인의 일부나 선택한 레이어를 복사하고 나머지는 변경합니다. |
reference | 음색, 리듬, 스타일, 단어, 비트 또는 사운드 질감에 따라 새로운 오디오를 생성합니다. |
weak_reference | 넓은 범주나 분위기의 유사성만 유지 |
오디오가 대상 화자를 안내할 때는 detailed_description에서 사용하는 동일한 화자 ID (Sx)에 연결하세요. 음색만 반영한다면 소스의 대사를 결과물에 복사하지 마세요.
로컬 제한 사항을 기억하세요. 오디오는 H3-Base-Ref2VA에 대한 유일한 미디어 참조가 될 수 없습니다. 이미지나 동영상을 포함하세요.
각 역할을 유지, 부분 유지, 누락, 충돌로 평가합니다.
| 검수 항목 | 질문 |
|---|---|
| 정체성 | 의도한 사람이나 물체가 장면 전체에서 계속 인식 가능합니까? |
| 외관 | 명명된 색상, 의복, 재료, 라벨 또는 스타일이 존재합니까? |
| 형태 | 제품이 정의된 모양과 부품 관계를 유지했습니까? |
| 모션 | 요청된 작업이 의도한 경로와 속도를 따르나요? |
| 카메라 | 카메라가 원치 않는 소스 콘텐츠를 상속하지 않고 요청된 방향을 사용했나요? |
| 타이밍 | 각 참조가 지정한 샷 범위에서 시작되고 끝났나요? |
| 소리 | 오디오가 계획대로 복사, 참조 또는 새로 생성되었습니까? |
| 충돌 | 두 개의 참조가 동일한 속성을 놓고 경쟁했습니까? |
한 번에 하나의 관계만 수정하세요. 카메라만 의도와 다르다면 Video 1이 카메라만 제어한다고 명확히 쓰고 소스 제품은 제외합니다.
모델 동작을 의심하기 전에 공식 입력 규칙과 역할 계획을 확인하세요.
캐시, 양자화, 스텝 수, 노드 및 VRAM은 특정 로컬 설정에 영향을 미칠 수 있습니다. 그 효과는 구성에 따라 다릅니다.
로컬 H3-Base는 네이티브 스테레오 오디오로 768p 비디오를 생성합니다. 공개 릴리스에는 별도의 FL2VA 및 Ref2VA 체크포인트가 포함되어 있습니다.
전체 시스템에는 호스팅된 H3-Context-IR 및 H3-Regenerate-2K도 포함됩니다. Regenerate-2K는 768p 결과와 원래 컨텍스트를 사용하여 최대 2K 해상도로 다시 생성합니다.
Regenerate-2K는 기존의 업스케일러가 아니며 현재의 오픈 웨이트 릴리스에도 없습니다. 따라서 Ref2VA만 다운로드하면 완전한 로컬 2K 워크플로가 제공되지 않습니다.
FL2VA는 첫 번째 프레임, 마지막 프레임 또는 둘 다를 고정합니다. Ref2VA는 참조 이미지·비디오·오디오에 정체성, 스타일, 움직임, 카메라, 타이밍 또는 사운드 역할을 지정합니다.
로컬 모델 카드 기준으로 이미지 최대 9개, 비디오 3개, 오디오 클립 3개를 사용할 수 있으며, 혼합 파일은 총 12개 이하여야 합니다. 비디오와 오디오의 총길이는 각각 15초를 넘을 수 없습니다.
문서화된 로컬 Ref2VA 워크플로에서는 사용할 수 없습니다. 참조 오디오는 이미지나 비디오와 함께 제공되어야 합니다. 호스팅된 API에는 별도의 요청 규칙이 적용됩니다.
아니요. API에는 텍스트가 필요하지만 사용자가 6개 섹션을 모두 수동으로 제출할 필요는 없습니다. 이 구조는 정밀한 계획 방법입니다.
비디오는 동작 패턴, 카메라 경로, 리듬 또는 시간 구조를 안내할 수 있습니다. 완전한 재현을 보장하는 기능이 아니라 가이드로 사용해야 합니다.
H3-Base의 로컬 출력은 768p입니다. 공식 2K 경로에는 현재 오픈 웨이트 공개에 포함되지 않은 호스팅형 Regenerate-2K가 필요합니다.
다음 Ref2VA 요청 전에 참조 역할 시트를 작성하세요. 각 소스에 하나의 주요 역할을 지정한 뒤, 첫 번째 결과를 역할별로 검토합니다.
MiniMax H3는 곧 DomoAI에서 제공될 예정입니다. DomoAI에서 이용할 수 있게 되면 알려드리겠습니다.
Recent articles
© 2026 도모아이 페트.주식회사
도모아이