
內容表
要用 AI 讓照片自然動起來,避免結果顯得詭異,應先選擇清楚的原圖,並指定一個明確動作。人物、場景與風格交給圖片本身呈現;提示詞則主要交代什麼要動、鏡頭如何移動,以及哪些部分應保持不動。
本指南將說明如何選擇原圖、控制動態幅度、撰寫提示詞,以及修正臉部、手部、物件或背景出現的意外變化。
照片只呈現從單一角度看見的一瞬間,影片卻需要下一刻,以及再下一刻的畫面。人物轉頭時,生成器必須補出原本看不見的臉頰、下顎、耳朵與頭髮。鏡頭橫向移動時,也必須呈現原先藏在主體後方的內容。
原圖中的小問題,在動起來後也更容易被看見。模糊的手指可能改變形狀;與袖子邊界混在一起的杯子可能滑動;被頭髮遮住的臉,轉過去時可能看起來像另一個人。
提示詞無法找回原圖從未呈現的細節。很多時候,第一步應該是改善圖片,或減少要求的動作。
合適的原圖能讓重要部分一目了然。以人像來說,主要五官應該在照片中清楚可見。相較於臉被頭髮遮住或完全側面的照片,四分之三側面能提供更多資訊,讓生成器處理小幅度轉頭。
也要檢查手部,以及手正在接觸的物件。手指握住杯子、手機或商品時,會形成緊密重疊。如果這些邊緣原本就模糊不清,動起來後可能更糟。物件很重要時,請選擇手與物件界線清楚的原圖。
在預計移動的方向保留空間。如果窗戶幾乎已在畫面之外,人物就無法自然地轉向窗戶;如果頭部和雙手已經貼近邊緣,鏡頭也無法大幅推近。
拍攝商品時,請確保輪廓與標籤清楚。風景照則應讓前景與背景的深度容易辨認。如果原圖有明顯問題,別期待動態能把它藏起來,應先**透過圖片編輯修正圖片**再製作動畫。
主體、光線、背景與風格已經在圖片中呈現。重複描述所有內容,反而可能讓動作指示失去焦點。
第一個提示詞可以像下面這樣簡單:
鏡頭保持固定。女性慢慢望向窗戶。窗外的雨輕輕落下。
這段提示詞包含一個動作、一個鏡頭指示,以及一個小幅度的環境動態,不必重新描述整張照片。
商品畫面可以這樣寫:
鏡頭慢慢靠近瓶子。柔和的反光滑過玻璃表面。瓶子保持原位。
風景畫面則可以寫:
鏡頭沿著小徑緩慢向前移動。草隨風輕輕擺動。遠方的山保持穩定。
這些只是起點,不能保證結果。「鏡頭保持固定」可以減少鏡頭移動,卻不會凍結背景;「女性保持不動」可以減少人物動作,卻無法鎖定她的臉。
第一次生成出錯時,不要再加上一大段警告。把動作幅度縮小,或移除其中一個動作。
先決定觀眾第一眼應該注意什麼。當氛圍比動作重要時,可以讓背景動起來。雨、蒸氣、窗簾或移動的光線,都能為安靜畫面增添生氣。
需要用人物動作帶出劇情重點時,就讓主體動起來。眼神一瞥、呼吸或輕微轉頭,比同時出現多個動作更容易看懂。大幅轉頭再加上新表情,會要求生成器重建更多人物細節。
當原本的姿勢已經合適時,可以使用鏡頭移動。輕微推近能引導注意力,拉遠則能帶出環境。不過,鏡頭移動仍會改變整體構圖,因此無法保留每一處細節。
第一次嘗試只指定一種主要動態。先測試轉頭,再加入蒸氣、車流、焦點變化與環繞運鏡。
我們使用同一張咖啡館照片,觀察提示詞分別強調環境、人物或鏡頭時會產生什麼變化。這是一項實作測試,不是基準測試。我們檢查的影片都使用相同原圖與模型,片長同為 5 秒,畫面比例同為 16:9。

第一段影片使用的提示詞是:
鏡頭保持固定。咖啡館窗外的雨輕輕落下,杯中升起蒸氣。女性安靜地坐著。
開頭與原圖十分接近。到了中段,杯子上方已能清楚看見蒸氣。結尾時,女性的頭部、眼神和表情都已改變,街景細節也出現變化。

開頭的臉部、杯子與街景仍接近原圖。

到了中段,蒸氣已經可見,但臉部也已轉向較正面的位置。

結尾的表情與多處背景細節,已和開頭畫面不同。
第二段影片只要求一個人物動作:
鏡頭保持固定。女性慢慢把頭轉向下雨的窗戶。
從頭到尾都能清楚看出轉頭動作,但肩膀、手、杯子、裁切範圍與街景也跟著改變。要呈現新的臉部角度,就必須補上原圖沒有的資訊。

開頭保留了原本的四分之三側面角度,雙手也仍在杯子附近。

進行到一半時,轉頭動作清楚可見,肩膀與手部也開始跟著移動。

到了結尾,新的臉部角度已很明顯,但杯子、雙手、裁切範圍與街景不再與開頭完全一致。
鏡頭版本使用了以下提示詞:
女性大致保持不動,鏡頭稍微緩慢推近。咖啡館窗外持續下雨。
第一次測試鏡頭動態時,頁面重新整理後使用了 Auto 畫面設定,因此我們排除該結果,並重新生成修正為 16:9 的版本。那段影片沒有下載,也沒有逐幀檢查,所以無法據實判斷意外變化較少,還是問題更嚴重。
這些影片顯示了一個實際問題:只指定一個移動部分,生成器仍會製作畫面中的其他部分。請從頭到尾檢查臉部、手部、物件、裁切範圍與背景。
動作讓臉部露出新的角度時,臉部就會跟著改變。眼睛移動所需補足的資訊,比把頭從一側轉向另一側更少。
手部面積小、動作靈活,而且經常與物件重疊。握住杯子的手可能在碰到把手與袖子的同時遮住手指,因此小幅變化也會很明顯。
背景會改變,是因為動作改變了物件之間的空間關係。推近鏡頭會改變比例與裁切範圍;橫向移動則會露出原本被遮住的區域。動作幅度應符合原圖能支撐的範圍。
縮小轉頭幅度。眼神一瞥比把頭從一側轉向另一側的難度低。可以從角度更清楚的臉部照片開始,或改為移動雨、光線或鏡頭。不要再增加需要模型自行創造的表情。
檢查手指、物件邊緣與袖子是否容易區分。如果不容易,請修正圖片或選擇更清楚的版本。物件很重要時,讓手保持不動,改為移動反光或鏡頭。
移除鏡頭移動,先在固定視角下測試主要動作。如果氛圍很重要,只要求一個局部動態,例如玻璃上的雨水或杯子上方的蒸氣,而不是讓整個場景都動起來。如果結尾構圖已經確定,可以使用畫面引導,為生成器提供可見的目標。
加入一個容易辨認的變化,例如轉頭、緩慢推近、蒸氣或移動的光線。讓所有東西都動起來,可能只會使畫面變得忙亂,卻不會讓這一刻更清楚。
已有一張核准的靜態圖片,想生成短片並讓動作保有自由度時,使用**圖片轉影片**。DomoAI V2.4 與 V2.4.1 支援 5 秒或 10 秒影片。
畫面必須以特定構圖開始與結束,或需要呈現多個關鍵畫面時,使用**多幀轉影片**。Seedance 2.0 使用起始幀與結束幀。DomoAI 2.4.1 可使用 2 至 8 個關鍵幀,並在各段之間加入提示詞。
參考影片已包含需要的舞蹈、走路或手勢時,使用**角色轉影片**。由演出內容帶動目標角色,而不是要求一張靜態圖片憑空創造動作。
應根據現有素材選擇:一張靜態圖片、規劃好的多個畫面,或參考演出。先做出這項選擇,再為不適合的工具反覆調整提示詞。
成功的照片動畫需要足夠的動態,讓觀眾理解這一刻,同時避免其他地方的變化分散注意力。
從一張清楚的照片和一項動作要求開始。完整查看結果,找出不必要的變化,再於下一次嘗試調整動態設定。
可以讓臉部接近原圖,尤其是在要求的動作幅度較小時,但任何提示詞都無法保證臉部完全不變。請使用清楚的原圖、避免大幅轉頭,並在完整影片中檢查臉部。
影片需要原圖沒有呈現的新角度與新瞬間,生成器必須補出這些缺少的細節。主體或鏡頭的動作越大,需要重建的場景範圍就可能越多。
只使用動作需要的時間。眼神一瞥、一次呼吸或鏡頭推近,都能放進短片中。只有當畫面有明確進展時,較長的影片才有用;額外時間也會讓意外變化有更多機會出現。
人物動作是畫面重點時,就移動人物。原本姿勢已經合適,只需要引導注意力時,則移動鏡頭。如果必須讓人物樣貌貼近原圖,與大幅轉頭相比,輕微的鏡頭移動或背景動態可能只需要補出較少的臉部資訊。
最近的文章