
目次
WAVファイルは発話のタイミング、間、速度、演技を決め、ポートレートは顔を決めます。まず5秒か10秒だけ生成してください。 全編を作る前に、最初の言葉、1か所の間、最後に口が閉じる瞬間を確認します。
WAVは演技のタイミングを制御しますが、見た目の本人性を作ったり、自然な動きを保証したりはできません。問題を切り分けるときは、音声と画像の役割を分けて考えます。
音声が影響する項目:
音声が決めない項目:
静止画から作るしゃべる顔では、新しい顔の動きを生成します。一方、動画のリップシンクでは元動画の演技を引き継ぎ、主に差し替え音声に合わせて口の動きを変更します。
この違いは、静止画アニメーションと**動画を起点にしたリップシンク**を分ける基準にもなります。静止画ワークフローでは画像が被写体を、音声が話し方を提供します。動画ワークフローでは、演技がすでに元動画に含まれています。
技術的に有効なファイルでも、発話入力として適しているとは限りません。動画を生成する前に録音全体を聞き、明らかな問題を直します。
WAVの事前確認:
DomoAIの**AIアバター**は、最大80MBのMP3、WAV、M4Aに対応しています。BGMのない明瞭な声が最も確認しやすい出発点です。
選択したツールを確認せず、サンプルレートやビット深度を一律に指定しないでください。WAVはコンテナ名であり、対応エンコードは異なります。共通設定を決めつけるより、対応ファイルの中で明瞭な声を用意することが重要です。
テスト録音の中ほどに、短く自然な間を入れます。例:「最初のシーンができました。[間]一緒にタイミングを確認しましょう。」
この間が観察点になります。声が止まったとき、口も閉じるか落ち着く必要があります。 動き続ける場合は、残留ノイズ、音楽、息、室内音、または生成結果が原因かもしれません。
テストは短くします。5秒か10秒あれば、最初の言葉、1か所の間、最後の口の閉じ方を確認できます。
安定した動きを作るには、顔の情報が十分に見えるポートレートが必要です。きれいなWAVでも、隠れた口、強い横顔、ぼやけた顔は修復できません。
次の条件から始めます:
手、マイク、髪、影、アクセサリーで口を隠さないでください。クロップが狭すぎると、頭が動いたときに画面端の破綻が見える場合があります。
イラスト、アニメキャラクター、ペット、絵画、歴史人物の肖像は、通常の写真と顔の比率や質感が異なるため追加テストが必要です。目と口の形が明確な画像を選び、長いWAVを使う前に短いサンプルを生成します。
タイミングは合うのに顔が変わる場合、原因は画像か動きの指示です。**画像編集**で元画像を整えるか、動きを小さくします。顔は安定しているのに口の開始が遅い場合は、WAVまたは同期を確認します。
最初の生成は完成品ではなく、入力素材を検証するために行います。 結果の原因を判断できるよう、設定を簡潔に保ちます。
指示例:
自然に話す。頭の動きは小さく、ときどきまばたきし、間の部分では表情をニュートラルに保つ。
大きなジェスチャー、素早い首振り、極端な表情を重ねると、WAVのリップシンク自体を判断しにくくなります。
portraitA_wav-clean_motion-low_v01のように版名を明確にします。音声を修正したら新しい版名を付けます。設定記録があれば、複数の入力を同時に変えたクリップ同士を誤って比較せずに済みます。
タイミング、本人性、フレーミングに合格した版だけを、最後に**動画アップスケーラー**で処理します。
音声内の出来事に名前を付けて動画と比較すると、同期を判断しやすくなります。漠然と繰り返し再生するだけでは、修正につながる情報が得にくくなります。
次の観察点を記録します:
通常の音付き、ミュート、低速で各1回確認します。通常再生は視聴者体験を、ミュートは反復する頭の動きやちらつき、本人性の変化を、低速はずれが始まるフレームを確認するために使います。
タイムスタンプ付きの確認表を使います:
| 時刻 | 音声イベント | 映像確認 | 結果 | 次のテスト |
|---|---|---|---|---|
| 00:01 | 最初の言葉 | 発話と同時に口が動く | 合格 | なし |
| 00:08 | 意図的な間 | 口が動き続ける | 不合格 | 間のノイズを確認 |
| 00:17 | 最後の言葉 | 口を閉じるのが遅い | 要確認 | 末尾音声を切って再テスト |
フレーム単位で見た後は、必ず通常速度でも全編を確認します。低速でしか見えない小さなずれは通常視聴に影響しない場合がありますが、間のたびに起きるずれは影響しやすくなります。
見えている症状につながる入力だけを変更します。仮説なしに再生成すると、時間とクレジットを使って同じ失敗を繰り返すことがあります。
| 症状 | 主な原因 | 次のテスト |
|---|---|---|
| 無音中も口が動く | 残留ノイズ、音楽、息、モデルの動作 | より静かな間で短いサンプルを再生成 |
| 口の開始が遅い | 冒頭の無音、タイミングのずれ | 冒頭を切り、開始点を比較 |
| 早口部分の動きが弱い | 話す速度、口の情報不足 | 少し遅くするか、鮮明な画像を使う |
| 顔の下部が伸びる | 横顔、隠れた口、強すぎる動き | 正面画像に変え、動きを小さくする |
| 顔が別人になる | 細部不足、狭いクロップ、生成差 | 鮮明な画像と固定クロップを使う |
| 頭が固い | 動き不足、制限が強すぎる指示 | 小さな動きを1つ明示する |
| 後半で同期がずれる | 長いクリップ、音声の問題 | WAVを承認済みの短い区間に分ける |
1つの版につき変更は1項目だけにします。 音声の清掃、ポートレート交換、動き指示の変更を同時に行うと、何が改善につながったか判断できません。
長い台本は、自然な文やシーンの境界で分割します。各区間でポートレート、クロップ、動き指示を揃えます。別々のクリップでは顔位置や表情に差が出る場合があるため、編集後に接続部分を確認します。
自動化は、ポートレートとWAVが手動テストに合格してから始めます。アップロードに成功しても、映像が品質基準を満たすとは限りません。
APIワークフローでは、現行の認証方式とアップロード方法を確認し、**Talking Avatar API**でメディア参照、リクエスト項目、時間規則、コールバック、エラー応答を確認します。手動テストで検証した同じ画像と音声を渡し、タスクID、入力版、設定、出力、失敗状態を保存して追跡できるようにします。
実装の詳細は開発者向け資料にまとめ、クリエイター向け手順では素材の準備と検証に集中します。
いいえ。 対応する顔画像も必要です。音声がタイミングと演技を、画像が見た目の本人性を提供します。
通常は入れません。 声だけの音声のほうが分析と同期をしやすくなります。口のタイミング確認に合格した後、編集工程で音楽を追加してください。
間にノイズ、音楽、息、室内音が残っている可能性があります。 モデルが小さな動きを続ける場合もあります。波形を確認し、より静かな間を作って短く再生成します。
必ずしもそうではありません。 現在のツールが対応する形式を使い、明瞭な声を優先します。両方に対応する場合は、コンテナだけで品質を決めつけず、同じ録音で比較します。
鮮明なポートレートと、利用許諾のあるきれいな録音を使います。意図的な間を1つ入れ、時刻を記録し、問題が出たら1項目だけ変更します。短い版が安定してから全編を作ってください。
最近の記事
© 2025 ドメインページ(株)
どーもあい