從動態開始,而不是從提示詞開始。當你能看到模型在兩個已確認的視覺狀態之間移動,而不是自行發明結尾時,首尾幀控制就最容易理解了。
創作者 Adrian Rohnfelder 的 Kling 首尾幀示範影片展示了這個核心概念的實際運作:開場圖像確立了主體身份與構圖,結尾圖像設定了目的地,而生成過程必須在兩者之間建構出一條可信的路徑。請先觀看範例,再使用以下工作流程來設計不會相互衝突的端點配對。
本文內容
首尾幀控制實際上做了什麼
首尾幀控制並不等同於上傳兩張隨機圖片並要求 AI 將其混合。模型需要推斷出兩個固定視覺狀態之間可信的時間路徑。該路徑可以包含主體運動、鏡頭移動、環境變化,或三者的組合。
一個強而有力的起始幀能定義身份、構圖、光線以及場景的初始狀態。一個強而有力的結尾幀則定義目的地。如果兩張圖像相互兼容,生成器就能將更多能力投入到運動與轉場品質上。如果圖像衝突過多,模型可能會扭曲主體、憑空添加物件,或在最後幾秒內倉促完成轉場。

舉例來說,想像一支無線耳機的產品影片。起始幀顯示放在石質桌面上的閉合充電盒。結尾幀顯示同一個充電盒開啟,兩隻耳機微微懸浮在盒子上方。提示詞可以描述鏡頭緩慢推進,同時充電盒開啟、耳機升起。由於兩個端點都已呈現產品的幾何形狀,提示詞無需在每個時刻重新描述產品。
這與標準的圖像轉影片工作流程不同,在那種工作流程中,單張圖像強烈定義了開場,但模型對於鏡頭如何結束有更多自由發揮的空間。
建構屬於同一個鏡頭的兩幀畫面
最重要的準備步驟不是撰寫提示詞,而是確保首幀和尾幀看起來像是同一個連續鏡頭中的兩個時刻。
保持相同的主體身份。人物應具有相同的臉部特徵、髮型、服裝和身體比例。產品應保持相同的標誌、標籤版面配置、材質、形狀和顏色。場景應保留主要的建築特徵。當細微差異是計劃中的變形的一部分時,這些差異是可以接受的,但不相關的差異會產生不必要的模糊性。
鏡頭邏輯也必須保持兼容。若起始幀是從眼睛高度拍攝,而結尾幀是從極端俯視角度拍攝,則要求模型同時解決大幅度的鏡頭移動、主體重新定向以及場景重建,這雖然在足夠長的鏡頭中可行,但遠比從中景過渡到稍微緊湊一些的中近景要困難得多。
光線也應該有其變化的理由。如果第一張圖像是溫暖的日光,而最後一張圖像是黑暗的霓虹夜景,請明確描述轉場過程。否則,請使用相似的曝光、方向和色溫,讓模型能夠專注於運動,而非重新渲染每個表面的光線。

將提示詞寫成運動路徑,而非第二張圖像的描述
一旦端點確定,提示詞應說明兩者之間發生了什麼。不要在提示詞中花費大量篇幅重複圖像已呈現的細節。使用文字來描述運動、時間節奏、鏡頭行為以及因果關係。
一個實用的結構如下:
- 識別主體與起始動作。
- 按可見順序描述物理運動。
- 分別描述鏡頭移動。
- 說明哪些元素會改變,哪些必須保持穩定。
- 以預期的最終狀態作為結尾。
以耳機範例為例,一個聚焦的提示詞可以這樣描述:「鏡頭緩慢推向充電盒。盒蓋平順地開啟。兩隻耳機垂直升起,帶有細膩的高端產品旋轉感。保持充電盒的形狀、標誌、材質、桌面和光線不變。以所提供的開蓋幀作為精確結尾。」
這比添加一長串電影感形容詞更為實用。模型已擁有視覺參考,文字應告訴它鏡頭如何從 A 移動到 B。
當鏡頭移動是主要目標時,你也可以研究AI 鏡頭移動技巧。推進、環繞、平移或跟蹤移動在鏡頭中應有明確的理由,而非僅僅作為裝飾堆疊在提示詞中。
選擇模型能在可用時間內完成的轉場
首尾幀最常見的失敗情況之一,是在短片段中要求過多的變化。如果主體必須穿越整個房間、換裝、拿起產品、轉向鏡頭,並在不同位置結尾,生成器就必須在幾秒鐘內壓縮多個動作。結果可能看起來過於倉促或在物理上不可能實現。
每個鏡頭只規劃一個主要變化。短片的產品剪輯可能使用一次展示。人物肖像可能使用一次姿態變化。場景轉換可能使用一次鏡頭移動加上一次環境變化。更複雜的故事通常以幾個透過共享端點連接的片段呈現效果更佳。
這正是端點控制能夠協助處理較長序列的地方。生成第一個片段,匯出其最終幀,將該圖像用作下一個片段的第一幀,然後為第二個片段定義新的結尾幀。這種方法與更廣泛的AI 影片一致性技巧相輔相成,因為每個片段都從已確認的視覺狀態開始,而非從文字重新出發。

將首尾幀用於產品展示與受控變形
產品工作是最強的應用場景之一,因為觀眾很容易注意到細小的身份變化。從乾淨的產品初始狀態開始,以清晰設計的目標狀態結尾。範例包括:閉合包裝的開啟、鞋子旋轉至主要展示角度、化妝品瓶從平鋪移至手中,或設備螢幕從待機切換至啟動狀態。
對於變形效果,請確保變化具有清晰可辨的視覺路徑。如果休閒服裝變成正式西裝,請保持人物的姿態、鏡頭角度和背景相對穩定,以便服裝變化成為主要的變數。如果房間從空曠變為有家具,請在家具以受控順序出現的同時維持房間的幾何結構。
你也可以將首尾幀用於靜態圖像之間的轉場。Media.io 提供專用的AI 轉場工作流程,當目標是將兩個視覺狀態轉換為更精緻的轉場效果,而非創建長篇敘事鏡頭時,這些工作流程會非常實用。
在生成前先設計結尾來製作循環影片
當結尾狀態在生成前就已規劃好時,無縫循環更容易實現。如果你希望最終幀能自然地與開場重新銜接,請建構首尾圖像時確保主體位置、鏡頭構圖、亮度和運動方向相互匹配。
一個簡單的循環可以在幾乎相同的構圖中開始和結束,而中間包含動作內容。例如,一個咖啡杯可以從桌上開始,升入手中,在短暫的產品展示時刻旋轉,然後回到相同的桌面位置。另一種選擇是連續的鏡頭移動,其中最後一幀在剪輯後與新的第一幀在視覺上相互匹配。
不要期望僅憑端點配對就能保證完美的循環。檢查最後幾幀的運動速度和光線連續性。即使視覺上匹配,如果物體在剪輯點前突然停止,仍然可能感覺像是跳切。在剪輯器中,修剪轉場點,或在需要平滑細微時間或運動差距時使用AI 影片幀插值功能。

了解首尾幀並非正確控制方法的情況
端點控制功能強大,但並非在所有情況下都是最佳工具。當你關注身份和開場構圖,但希望模型自行探索結尾時,請使用單一起始圖像。當你特別需要從現有片段中複製鏡頭或肢體運動時,請使用運動參考。當版面配置和景深是主要限制條件時,請使用構圖參考。
一個實用的原則是:針對最重要的不確定性進行約束。如果結尾必須呈現特定的產品角度,請使用尾幀。如果結尾具有彈性,但鏡頭必須複製複雜的環繞移動,則優先使用運動參考。
修正常見的首尾幀失敗問題
主體在中途發生變形
檢查首幀和尾幀是否真正呈現相同的身份。臉部、產品幾何形狀、服裝或標誌位置上的差異,可能迫使模型混合不相容的形態。使用更乾淨的參考圖像,並減少其他場景變化的數量。
動作看起來太快
端點之間的視覺距離可能對於可用時長來說過大。將兩幀畫面靠近一些、簡化動作,或將想法拆分為兩個片段。
最後一幀只在最後瞬間出現
描述通往端點的過程,而不只是端點本身。如果最終姿態很重要,請要求主體在結尾前就進入所提供的姿態,使最終狀態有足夠的時間被觀眾感知。
鏡頭出現奇怪的跳動
比較兩張圖像中的地平線、焦距和鏡頭角度。嚴重的不匹配可能導致不自然的最終修正。建構更兼容的尾幀,或明確描述連接兩者的鏡頭移動方式。
文字和標誌在運動中失真
將細小文字視為脆弱元素。保持品牌表面足夠大以維持可讀性、減少極端旋轉,並避免長時間遮擋。對於商業素材,請以完整尺寸逐幀檢視產品,而非僅判斷整體運動效果。

使用 Media.io 將已確認的幀轉換為影片的實用工作流程
如果你的首幀和尾幀已經準備好,請將 Media.io 作為生成過程中的創作與後製層。當你想要為已確認的靜態圖像製作動畫,或測試模型驅動的圖像轉影片工作流程時,請從Media.io Video AI開始。將來源幀保持相同的長寬比,並以合適的解析度匯出,以避免生成器被迫推斷缺失的裁切區域。
生成後,檢視片段的身份穩定性、端點準確性、運動速度,以及任何意外發生變化的物件。如果一個短片段表現優異,但需要與另一個生成片段連接,請擷取其最終確認幀,並將其用作下一個視覺錨點。這為你提供了一個可重複的逐幀製作流程,而無需期望一個長提示詞能解決整個序列的所有問題。
匯出前的最終品質確認清單
請以完整解析度使用以下清單,而非僅在小型預覽中確認:
- 第一個生成幀與預期的起始構圖相符。
- 主體或產品在整個片段中保持相同的身份。
- 主要動作有足夠的時間自然完成。
- 鏡頭移動有一個明確的方向,且沒有無法解釋的修正。
- 最終狀態在片段結束前就已清晰可辨。
- 標誌、標籤、雙手、臉部和直線邊緣保持穩定。
- 光線僅在故事需要時才發生變化。
- 最終幀在後續片段接續時能作為乾淨的錨點使用。
一支優質的首尾幀 AI 影片不會讓人感覺像是在兩張圖像之間播放的幻燈片,而是像一個連續的鏡頭,其開場和結尾都經過刻意的藝術指導。錨點越兼容,模型需要自行發明的內容就越少,你就能將更多注意力放在運動、節奏和故事敘述上。

關於首尾幀 AI 影片的常見問題
-
什麼是首尾幀 AI 影片生成器?
這是一種 AI 影片工作流程,使用一張圖像定義片段的開場,並使用另一張圖像定義結尾。模型負責生成這兩個固定或強烈引導的狀態之間的運動和視覺轉場。
-
首尾幀與一般影片剪輯中的關鍵幀相同嗎?
它們作為視覺錨點在概念上相似,但 AI 是在生成中間的內容,而非僅僅插值普通的變換數值。模型仍然需要自行決定人物、物件、光線和鏡頭運動在圖像之間如何演變。
-
我可以使用兩張完全不同的圖像嗎?
可以,但主體、鏡頭、光線和場景幾何形狀的兼容性越低,轉場就越困難。為了獲得可預期的結果,請將兩張圖像設計為同一個鏡頭中的兩個時刻,或作為一個清晰規劃的變形過程。
-
首尾幀控制適合用於產品影片嗎?
是的,當產品必須在已確認的狀態下開始和結束時,這種方式特別有用,例如閉合與開啟的包裝、平鋪展示與主要展示角度、靜態產品與最終展示揭露。
-
如何在多個片段之間保持角色的一致性?
重複使用已確認的幀作為錨點、保持身份參考的一致性、限制不必要的服裝或光線變化,並在使用每個生成片段的最終幀作為下一個起點之前,先審視該片段。對於較長的序列,請將端點控制與更廣泛的角色一致性方法結合使用。
-
如果結尾是正確的,但中間部分看起來有問題,我該怎麼辦?
減少運動量、縮短錨點之間的視覺距離、使提示詞更清晰地描述物理路徑,或將想法拆分為多個片段。端點的準確性並不能保證每個中間運動的選擇都是自然的。