
內容表
WAV檔案提供發話時間、停頓、速度與表演;人像則提供臉部。先生成5秒或10秒的測試片段。 製作完整影片前,先檢查第一個字、一段停頓,以及最後閉嘴的時機。
WAV會控制表演節奏,但無法提供視覺身分,也不能保證動作自然。排查問題時,應把音訊與圖片的責任分開。
音訊可以影響:
音訊不會決定:
以人像為起點的會說話照片,需要重新生成臉部動作。影片式唇形同步則沿用原片中的表演,主要讓嘴型跟隨替換後的音訊。
這也區分了人像動畫與**以影片為起點的唇形同步**。在人像流程中,圖片提供主體,音訊提供說話方式;在影片流程中,表演已存在於來源影片。
檔案即使技術上有效,也可能不是良好的語音輸入。生成影片前,請完整聆聽錄音並修正明顯問題。
WAV預檢清單:
DomoAI的**數位化身**支援最大80MB的MP3、WAV與M4A。沒有背景音樂、清楚可辨的人聲最適合作為起點。
不要在未確認工具規格前指定固定取樣率或位元深度。WAV是容器名稱,不同工具支援的編碼可能不同。符合格式且清楚可懂的語音,比套用一個通用技術設定更重要。
在測試錄音中段放入短而自然的停頓。例如:「你的第一個場景完成了。[停頓]我們一起檢查時間。」
停頓會形成可觀察的同步點:聲音停止時,嘴巴也應閉上或安定下來。 若嘴巴仍持續移動,原因可能是殘留噪音、音樂、呼吸、環境底噪或生成結果本身。
測試檔保持簡短。5秒或10秒足以查看第一個字、一段停頓與最後閉嘴的時機。
圖片必須提供足夠的臉部資訊,才能生成穩定動作。乾淨的WAV無法修復被遮住的嘴、過度側面的臉或模糊的人像。
建議使用:
避免手、麥克風、頭髮、陰影或配件遮住嘴巴。裁切太緊也可能在頭部移動時產生邊緣瑕疵。
插畫、動漫角色、寵物、畫作與歷史肖像的臉部比例或質感不同,通常需要更多測試。選擇眼睛和嘴型清楚的素材,使用長WAV前先生成短片。
若時間正確但角色身分漂移,問題通常在圖片或動作指示。先用**圖片編輯**修正來源,或降低動作幅度。若臉部穩定但嘴巴啟動較晚,則檢查WAV與同步設定。
第一次生成的目的,是測試輸入,而不是直接完成最終作品。 保持設定簡單,才能把每個結果連回明確原因。
指示範例:
自然說話,頭部動作小,偶爾眨眼;停頓時保持中性表情。
不要同時堆疊互相衝突的指示。大幅手勢、快速轉頭或極端表情,會讓WAV唇形同步本身更難判斷。
請清楚命名每個版本,例如portraitA_wav-clean_motion-low_v01。音訊修改後使用新的版本名稱。設定記錄可避免比較到同時更改多個輸入的片段。
只有在時間、身分與構圖都通過檢查後,才對保留的結果使用**影片畫質提升**。
把音訊中的關鍵時刻命名,再與影片對照,會比反覆隨機播放更容易找到可修正的問題。
標記以下檢查點:
分別用正常音量、靜音與慢速各看一次。正常播放呈現觀眾體驗;靜音可暴露重複頭部動作、閃爍和身分漂移;慢速可定位錯位開始的畫格。
使用帶時間標記的檢查表:
| 時間 | 音訊事件 | 視覺檢查 | 結果 | 下一步 |
|---|---|---|---|---|
| 00:01 | 第一個字 | 嘴巴與聲音同時開始 | 通過 | 無 |
| 00:08 | 有意停頓 | 嘴巴持續移動 | 失敗 | 檢查停頓中的噪音 |
| 00:17 | 最後一個字 | 嘴巴太晚閉上 | 複查 | 裁掉尾端音訊再測 |
逐格檢查後,仍要用正常速度播放完整片段。只在慢動作中看得到的小偏差未必影響觀看,但每次停頓都出現的錯位通常會有影響。
只修改與症狀直接相關的輸入。沒有假設就反覆生成,可能會浪費時間與點數,卻一直得到相同問題。
| 症狀 | 可能來源 | 下一個測試 |
|---|---|---|
| 靜音時嘴巴仍動 | 殘留噪音、音樂、呼吸或模型動作 | 使用更乾淨的停頓重跑短片 |
| 嘴巴啟動較晚 | 前導靜音或時間錯位 | 裁掉開頭後比較起點 |
| 快速字詞表現弱 | 語速太快或嘴部細節不足 | 稍微放慢或換更清楚的人像 |
| 下半臉拉伸 | 側臉、嘴被遮住或動作太強 | 使用正面素材並降低動作 |
| 臉部身分改變 | 細節不足、裁切過緊或生成差異 | 使用清晰來源並固定裁切 |
| 頭部太僵硬 | 動作不足或指示限制過多 | 測試一個小而明確的動作 |
| 後段時間漂移 | 片段太長或音訊問題 | 將WAV拆成較短的核准區段 |
每個版本只改一個變因。 若同時清理音訊、換人像並重寫動作指示,就無法確認是哪個修改帶來改善。
長文案可在自然句子或場景邊界拆段。各段保持相同人像、裁切與動作指示。分段生成可能造成臉部位置或表情略有不同,剪輯後要檢查接點。
先用手動測試確認人像與WAV,再開始自動化。檔案成功上傳,不代表視覺結果符合品質標準。
API流程應先確認現行驗證與上傳方式,再參考**Talking Avatar API**的媒體引用、請求欄位、長度規則、回呼行為與錯誤回應。傳入手動測試使用過的同一組圖片和音訊,並保存工作ID、輸入版本、設定、輸出與失敗狀態,以便追蹤重複工作。
完整API實作留在開發者文件;創作者流程應集中在媒體準備與驗證。
不可以。 還需要相容的臉部圖片。音訊提供時間與表演,圖片提供視覺身分。
通常不應該。 純語音更容易分析與同步。會說話影片通過聲音和嘴型檢查後,再於剪輯階段加入音樂。
停頓中可能還有噪音、音樂、呼吸或環境底噪。 模型也可能持續小幅動作。檢查波形,建立更乾淨的有意停頓,再比較一次短片生成。
不一定。 使用工具目前支援的格式,並優先確保語音清楚。若兩種格式都支援,請用同一份錄音比較,不要假設容器格式決定唇形同步品質。
使用清楚的人像和獲得授權的乾淨錄音。加入一段有意停頓、標記時間,發生問題時一次只改一個變因。短片穩定後,再製作完整版本。
最近的文章