
Table of Content

Try DomoAI, the Best AI Animation Generator
Turn any text, image, or video into anime, realistic, or artistic videos. Over 30 unique styles available.
좋은 MiniMax H3 프롬프트는 입력에 맞는 모드를 선택하는 것에서 시작합니다. 그다음 영상 타임라인, 대사, 물리적 소리, 관객에게만 들리는 음악을 구분합니다. 이 가이드는 T2VA, I2VA, FL2VA, L2VA와 네이티브 오디오 지시를 위한 복사 가능한 원본 템플릿을 제공합니다. 모든 템플릿은 MiniMax의 공식 형식을 따릅니다.
올바른 구조는 H3에 더 명확한 지침을 제공하지만 정확한 컷, 음성, 텍스트, 모션 또는 프레임 일치를 보장할 수는 없습니다.
아래 프롬프트는 MiniMax 공식 문서에 제공된 예를 기반으로 합니다.
먼저 준비한 시각 자료를 확인하세요. 약어가 더 고급스러워 보인다는 이유만으로 모드를 선택해서는 안 됩니다.
| 모드 | 제공된 입력 | 프롬프트 첫 줄의 역할 | 적합한 용도 |
|---|---|---|---|
| T2VA | 없음 | 장면, 피사체, 동작, 샷 및 전체 오디오 계획 수립 | 텍스트에서 새로운 시청각 아이디어 만들기 |
| I2VA | 첫 번째 프레임 1개 | 시작 이미지를 완전히 참조한 뒤 이어질 내용을 설명 | 준비된 오프닝 컴포지션에 애니메이션 적용 |
| FL2VA | 첫 번째 프레임과 마지막 프레임 | 두 이미지를 정렬하고 그 사이의 가시적인 변화를 설명 | 전환 시작 및 종료 제어 |
| L2VA | 마지막 프레임 | 제공된 마지막 프레임에 자연스럽게 도달하는 앞부분을 구성 | 결말에서 역산해 등장 장면이나 변화를 설계 |
| Ref2VA | 참조 이미지 및/또는 비디오(선택적 참조 오디오 포함) 오디오는 유일한 참조 입력이 될 수 없습니다 | 전체 참조 형식으로 각 자료의 역할을 지정 | 여러 소스로 정체성, 스타일, 움직임, 카메라 또는 사운드를 안내 |
MiniMax는 공식 H3-Base 프롬프트 가이드에서 이 네 가지 기본 모드를 설명합니다. Ref2VA는 별도의 6개 섹션 구성 방식을 사용하므로 고급 워크플로로 구분합니다.
기본 프롬프트를 타임라인, 실제 사운드, 청중 전용 음악의 세 가지 레이어로 생각하세요.
integrated_multimodal_description:
[Shot 1] Describe the subjects, setting, visible action, camera, dialogue, and any sound tied to this moment.
[Shot 2] At 00:03.000, describe the next visible and audible event.
overall_soundscape:
Describe ambience, physical sound effects, and non-verbal human sounds across the clip.
non_diegetic_music:
Describe the audience-only score, or write N/A when no score is wanted.
integrated_multimodal_description에는 재생 순서를 적습니다. 샷, 동작, 대사, 노래, 화면에 표시할 텍스트, 동기화할 소리를 이 필드에 넣으세요.
overall_soundscape에는 실내 환경음, 바람, 교통 소리, 발소리, 충돌음, 옷 스치는 소리, 숨소리 등 물리적 소리를 적습니다. 대사 전체를 이 필드에 반복하지 마세요.
non_diegetic_music에는 관객에게만 들리는 음악을 적습니다. 장면 속 라디오나 연주자가 내는 음악이라면 해당 사건을 타임라인에 작성하세요.
다음 7개 부분으로 구성된 워크플로를 사용하세요.
T2VA에는 영상 정렬 라인이 없습니다. 세 가지 필드부터 시작하여 텍스트의 모든 것을 설정하세요.
아래 예시는 8초 길이의 제품 공개 장면을 만듭니다. 샷마다 동일하게 유지할 제품 설명은 ‘사각형 호박색 유리 향수병, 무광 검정 캡, “NORTHLINE”이라고 적힌 크림색 라벨’입니다.
테스트 전에 바뀌면 안 되는 제품 세부 정보를 나열하세요. 제품 비디오 일관성 가이드에서는 이러한 요소를 합격 기준으로 바꾸는 방법을 설명합니다.
실행 조건: T2VA · 8초 · 16:9 · 입력 이미지 없음.
integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. A square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" stands on a wet black-basalt plinth inside a greenhouse before sunrise. Cold blue window light reaches the bottle from camera right. The camera makes a slow, small-amplitude push toward the plinth. Water beads slide down the glass while fern leaves move gently behind it. [Shot 2] At 00:04.000, the camera cuts to a close-up of the same square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE". A narrow amber light sweeps from left to right across the bottle. The label stays front-facing and readable. One water bead reaches the base as a quiet off-screen woman (S1) says: <d>[English] Find your north.</d> The shot holds steady through the final frame. No extra bottle, label, subtitle, or watermark appears.
overall_soundscape: Light greenhouse rain taps on the glass roof. Leaves rustle softly while water drops strike the basalt surface. A low room tone continues beneath the voice.
non_diegetic_music: Three isolated felt-piano strikes sound during the first half. A bowed-glass drone rises twice, then stops two seconds before the end.
라벨, 음성, 빛의 이동, 동기화된 물방울은 타임라인에 배치하고, 빗소리와 나뭇잎 소리는 사운드스케이프에 배치했습니다.
I2VA에서는 제공한 이미지가 0.00초의 실제 첫 프레임이 됩니다. MiniMax가 지정한 첫 줄을 사용한 뒤 이미지에 이미 나타난 내용을 기준으로 다음 전개를 작성하세요.
첫 프레임을 문장으로 다시 설계하지 마세요. 움직임을 추가하기 전에 화면에 보이는 제품, 구도, 조명, 색상, 공간 관계를 유지하세요.
실행 조건: I2VA · 8초 · 16:9 소스 프레임 · Picture 1이 시작 제품 샷.
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. The square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" remains in the position, scale, lighting, and greenhouse composition established by <Picture 1>. The camera arcs clockwise with small amplitude at slow speed. Water beads move down the glass while the background fern leaves shift in a light draft. A narrow amber reflection begins at the bottle's left edge and travels across its front face. The label remains front-facing and readable. At the end, the camera stops and holds the original product as the brightest object. No extra bottle, label, subtitle, or watermark appears.
overall_soundscape: Soft rain taps the greenhouse roof while leaves brush against one another. Water drops strike the basalt plinth at irregular intervals.
non_diegetic_music: A muted handpan sounds once every two seconds. One airy synthesizer tone enters halfway and recedes before the final frame.
이 프롬프트는 이미지에서 자연스럽게 이어질 수 있는 변화만 설명합니다. 카메라를 움직이는 동안 제품이나 장면이 다른 대상으로 바뀌는 것을 방지하는 구성입니다.
FL2VA는 양쪽 끝을 고정합니다. 프롬프트는 그림 1과 그림 2 사이의 가시적 경로를 설명해야 합니다.
연속 보간을 원할 경우 원샷을 사용합니다. 창의적인 계획에 꼭 필요한 경우에만 컷을 추가하세요.
실행 조건: FL2VA · 8초 · 동일한 16:9 소스 프레임 · Picture 1은 0.00초 · Picture 2는 8.00초.
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 8.00-second mark of the target video.
integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. At the opening instant, Picture 1 determines the square amber-glass perfume bottle's location, size, and framing. It has a matte-black cap and a cream label reading "NORTHLINE". The camera trucks right with small amplitude at slow speed. A thin stream of water crosses the basalt plinth from left to right. The greenhouse light shifts gradually from cold blue dawn toward Picture 2's warm amber direction. Fern shadows travel across the background, then settle. The bottle does not rotate, and its label remains front-facing. By the last frame, the camera, water, reflections, shadows, and lighting match Picture 2's spacing, viewing angle, and composition. No extra bottle, label, subtitle, or watermark appears.
overall_soundscape: Rain decreases gradually as water runs across the stone. The final drops become farther apart before the scene settles into quiet greenhouse ambience.
non_diegetic_music: N/A
효과적인 FL2VA 프롬프트는 카메라 이동, 물의 위치, 조명 변화, 그림자 움직임처럼 중간에 일어날 변화를 구체적으로 적습니다.
L2VA는 그림 1을 오프닝이 아닌 엔딩으로 만듭니다. 사용 가능한 시간 내에 해당 프레임에 도달할 수 있는 그럴듯한 초기 상태를 선택합니다.
공식 첫 줄에는 마지막 샷 번호와 소수점 둘째 자리까지 표시한 실제 길이를 사용합니다. 한 샷으로 구성된 8초 프롬프트라면 8.00-second로 끝나며 Shot 1을 지정합니다.
실행 조건: L2VA · 8초 · 16:9 최종 프레임 입력 · Picture 1이 마지막 제품 구도.
How the reference pictures align with the target video — <Picture 1> (from [Shot 1]) aligns with the 8.00-second mark of the target video.
integrated_multimodal_description: [Shot 1] Live-action, cinematic product film. An empty wet black-basalt plinth fills the foreground inside a dark greenhouse before sunrise. The camera pulls out with small amplitude at slow speed. From the left, a square amber-glass perfume bottle, matte-black cap, cream label reading "NORTHLINE" slides smoothly onto the plinth and slows as it reaches center. Cold blue light from the right changes gradually to a narrow amber beam from the left. Water beads become visible on the bottle. During the final two seconds, every moving element comes to rest. The object placement, scale, camera view, reflections, label direction, fern shadows, and illumination now match <Picture 1>. No extra bottle, label, subtitle, or watermark appears.
overall_soundscape: Rain taps the greenhouse roof while glass slides softly over wet stone. The sliding sound slows and stops as one final drop strikes the plinth.
non_diegetic_music: Four muted glass harmonics sound at even intervals. The fourth ends as the bottle stops moving.
역방향 계획은 시작 상태에서 몇 가지 변경만 필요할 때 가장 잘 작동합니다.
첫 번째 샷에는 타임스탬프가 없습니다. 이후의 모든 샷은 목표 지속 시간 내에서 컷 시간이 엄격하게 증가하면서 시작됩니다.
MiniMax가 문서화한 샷 라벨 형식은 다음과 같습니다. 아래의 줄임표는 임시 문장을 뜻합니다.
[Shot 1] Live-action, cinematic, a medium-wide shot establishes...
[Shot 2] At 00:03.500, the camera cuts to...
[Shot 3] At 00:06.250, the shot switches to...
한 샷 안에서 이어지는 동작을 타임스탬프로 표시하지 마세요. 컷이 없다면 ‘샷 중간에’처럼 문장으로 설명합니다.
카메라 방향에는 먼저 모션 유형이 필요합니다. 결과를 정의하는 데 도움이 되는 경우에만 진폭과 속도를 추가하세요.
| 약한 방향 | 더 명확한 방향 |
|---|---|
| 시네마틱 카메라 | 카메라가 느린 속도와 작은 이동 폭으로 전진합니다 |
| 역동적인 움직임 | 카메라가 빠른 속도와 큰 이동 폭으로 왼쪽으로 트래킹합니다 |
| 라벨에 집중하세요 | 빛이 라벨을 통과하는 동안 카메라는 고정된 클로즈업을 유지합니다. |
| 제품 주위를 회전 | 카메라가 느린 속도와 작은 이동 폭으로 시계 방향의 원호를 그립니다 |
프롬프트 구문을 작성하기 전에 컷을 설계하세요. AI 스토리보드 가이드에서는 애니메이션 제작 전에 샷의 목적과 연속성을 정하는 방법을 설명합니다.
H3는 네이티브 스테레오 오디오로 비디오를 생성하므로 오디오 방향은 초기 프롬프트에 속합니다. 네 가지 사운드 작업을 서로 다르게 유지하세요.
| 사운드 역할 | 작성 위치 | 예 |
|---|---|---|
| 대화나 노래 | integrated_multimodal_description | (S1) says: <d>[English] Find your north.</d> |
| 동기화된 이벤트 | 타임라인의 현재 샷 | 손으로 놓으면 캡이 딸깍 소리를 내며 닫힙니다. |
| 분위기와 물리적 사운드 | overall_soundscape | 비, 발자국, 천, 충격, 호흡 |
| 관객에게만 들리는 음악 | non_diegetic_music | 악기 편성, 템포, 리듬, 볼륨 변경 |
목소리가 처음 등장하는 순서대로 (S1), (S2)와 이후 ID를 지정합니다. 모든 샷에서 같은 목소리에 같은 ID를 사용하세요.
<d> 안에는 언어 태그와 실제로 말할 문장만 넣습니다. 화자 설명, 동작, 말투, ID는 태그 밖에 작성하세요.
The calm off-screen woman (S1) says: <d>[English] Find your north.</d>
The shopkeeper with a low, measured voice (S2) replies: <d>[English] It was here all along.</d>
보이스오버를 지정할 때는 MiniMax의 명시적인 표현을 사용하고 화면 속 인물의 입은 닫힌 상태로 유지하세요.
The woman (S1) says in an off-screen voiceover: <d>[English] I kept the first bottle.</d> while her lips remain completely closed.
환경음과 효과음만 필요하고 관객용 음악은 원하지 않는다면 N/A를 non_diegetic_music에 작성합니다. 완전한 무음을 원할 때만 overall_soundscape: N/A를 사용하세요.
표시되는 텍스트에는 큰따옴표가 필요합니다. 구두점을 포함하여 정확하게 복사하세요. 레이블을 인용하면 명령의 명확성이 향상될 수 있지만 완벽한 텍스트 렌더링이 보장되지는 않습니다.
스타일 단어를 변경하기 전에 구조부터 시작하십시오. 한 번에 하나의 변수를 변경한 후 다음 출력을 동일한 승인 확인과 비교하십시오.
| 실패 | 예상되는 프롬프트 문제 | 공식 형식 수정 |
|---|---|---|
| 다른 인물이 대사를 말함 | ID가 바뀌었거나 화자를 처음부터 지정하지 않음 | 각 목소리가 처음 등장할 때 고정된 (S1), (S2) ID를 지정하고 이후에도 재사용 |
| 원하지 않는 배경 음악이 나타납니다. | 음악 필드가 모호하거나 누락됨 | non_diegetic_music: N/A라고 쓰고 필요한 물리적 소리는 overall_soundscape에 유지 |
| 타임스탬프가 무시된 것 같습니다. | 타임스탬프가 컷이 아닌 동작을 표시하거나 클립 길이를 벗어남 | 두 번째 이후 샷에만 타임스탬프를 쓰고 컷 시간을 클립 안에서 오름차순으로 지정 |
| 영상에 불규칙한 컷이 생김 | 사소한 각도 변경은 별도의 샷으로 작성되었습니다. | 새 정보를 보여주는 컷이 아니라면 한 샷을 유지하고 카메라 움직임으로 설명 |
| FL2VA는 엔드포인트 간을 점프합니다. | 프롬프트는 두 가지 정적 설명을 반복합니다. | 마지막 프레임에 점진적으로 도달하는 가시적인 중간 변화를 지정 |
| L2VA가 이미지를 시작 프레임으로 처리함 | 마지막 프레임 정렬 문장이나 최종 일치 지시가 누락됨 | L2VA 지시를 첫 줄에 두고 마지막에만 이미지와 일치하도록 작성 |
| 보이는 텍스트가 드리프트됩니다. | 텍스트가 다른 말로 표현되었거나 인용되지 않았습니다. | 영어 큰따옴표 안의 정확한 텍스트를 유지한 후 결과를 검토하세요. |
| 대사가 사운드스케이프에 반복됨 | 음성 단어가 여러 필드에 복사되었습니다. | 대사 전체는 시각적 타임라인의 <d> 안에만 작성 |
이러한 수정은 지시를 더 명확하게 만들지만, 모든 생성 결과가 세부 사항을 완벽히 따르도록 보장하지는 않습니다.
여러 소스 파일에서 정체성, 움직임, 카메라, 음성을 가져와야 한다면 이 기본 형식을 계속 확장하지 마세요. Ref2VA와 공식 전체 참조 가이드를 사용하세요.
이 체크리스트를 프로덕션 노트에 복사하세요.
[Shot 1]에는 타임스탬프가 없고, 이후 컷 시간은 오름차순이며 클립 길이 안에 있다.(Sx) ID를 일관되게 사용한다.<d> 안에 있다.overall_soundscape에 있다.non_diegetic_music에 있으며, 필요하지 않다면 같은 필드에 N/A가 적혀 있다.공식 Video Generation V2 API 레퍼런스에서는 비어 있지 않은 텍스트 프롬프트를 요구합니다. 또한 첫 프레임과 마지막 프레임의 역할을 참조 미디어 역할과 구분하므로, 한 API 요청에서 두 역할군을 섞지 마세요.
입력에 맞는 모드를 먼저 선택한 뒤 integrated_multimodal_description, overall_soundscape, non_diegetic_music 세 필드를 사용합니다. I2VA, FL2VA, L2VA에서는 이 필드 앞에 공식 이미지 정렬 문장을 추가합니다.
T2VA는 텍스트에서 시작하고, I2VA는 첫 프레임에서 시작합니다. FL2VA는 첫 프레임과 마지막 프레임을 연결하며, L2VA는 제공된 마지막 프레임에 도달하도록 구성합니다.
목소리가 처음 등장할 때 (S1), (S2)처럼 고정 ID를 지정하고 모든 샷에서 같은 ID를 사용합니다. <d> 안에는 언어 태그와 실제 대사만 넣습니다.
샷에 맞춰야 하는 효과음은 해당 샷에, 전체 환경음은 overall_soundscape에 적습니다. 관객만 듣는 음악이 필요하지 않다면 non_diegetic_music: N/A라고 씁니다.
타임스탬프가 컷이 아닌 동작을 표시하거나, 이전 시간을 반복하거나, 클립 길이를 벗어나면 적용되지 않을 수 있습니다. Shot 2 이후의 컷에만 사용하고 시간을 오름차순으로 배치하세요.
H3-Base Ref2VA에 직접 프롬프트를 작성할 때는 피사체 정의, 요약, 유지 항목, 상세 재생 순서, 사운드스케이프, 음악의 여섯 섹션을 사용합니다. 호스팅 API에서는 참조 미디어와 비어 있지 않은 텍스트 프롬프트를 함께 보낼 수 있습니다.
이제 입력에 맞는 H3 모드를 선택하고, 타임라인을 작성하며, 오디오 레이어를 구분할 수 있습니다. 다음 생성 전에 해당 템플릿을 저장하고 QA 체크리스트를 확인하세요.
MiniMax H3는 곧 DomoAI에 추가될 예정입니다. DomoAI에서 사용할 수 있게 되면 소식을 전해 드리겠습니다.
Recent articles
© 2026 도모아이 페트.주식회사
도모아이