三張參考圖片只有在每張都有明確用途時才能發揮作用。Veo 3.1「素材轉影片」功能的重點不在於上傳更多圖片,而在於將角色特徵、產品特性和環境線索分開,讓模型不必自行猜測哪些細節是重要的。
Google DeepMind 的官方示範是了解這個概念的好起點。它展示了多張參考圖片如何引導生成場景中的角色、物件和風格,而非強迫單一圖片定義所有內容。
| 參考類型 | 最佳用途 |
|---|---|
| 角色 | 臉部、髮型、服裝與身體特徵 |
| 產品或物件 | 形狀、材質、包裝與可辨識的細節 |
| 場景或風格 | 環境、光線方向與視覺語言 |
本文內容
什麼是 Veo 3.1 中的「素材」
「素材」是一張告訴模型重要視覺元素應呈現何種樣貌的參考圖片,它與作為第一幀的起始圖片不同。參考圖片可以引導內容生成,而無需強迫整個生成幀完全複製其構圖。
一組實用的素材可能包含:
- 一張含有清晰臉部與服裝的角色參考圖。
- 一張能清楚呈現形狀、包裝與材質的產品參考圖。
- 一張定義環境或視覺語言的場景或風格參考圖。
當特徵辨識是主要挑戰時,你也可以對同一個對象使用多張圖片,但請記住 API 目前最多允許三張參考圖片,因此素材組合應經過審慎篩選。
如果你的目標只是將單張靜態圖片製作成簡單動畫,而非進行多參考圖片的控制,標準的圖片轉影片工作流程可能更為快速。當多個視覺元素都需要在生成過程中保持完整時,素材功能才能發揮其最大價值。
為每張參考圖片賦予明確的單一用途
製作出令人困惑的參考組合最簡單的方式,就是上傳三張各自暗示不同場景的精美圖片。因此,在上傳之前,請先寫下每張圖片的用途。

對於一支時尚產品影片,各圖片的用途可能是:
- 角色特徵:模特兒的臉部、髮型與身體比例。
- 產品特徵:確切的手提包樣式,包含形狀、提把、五金配件與顏色。
- 環境:一個陽光照耀的地中海風格飯店露台,背景為淺色石材與海景。
如此一來,文字提示詞就能專注於動作描述:角色拿著包包走過露台,轉向鏡頭,一手扶著欄杆,鏡頭從中景追蹤鏡頭推進至以產品為主的近景。
這比使用三張生活風格照片要清晰得多,因為那些照片中的人物、包包、背景和光線從一張到下一張都在改變。

生成前先準備好參考圖片
參考圖片的品質會影響模型需要自行推斷的內容。請使用重要主體夠大、清晰可辨,且未被大量特效遮蔽的圖片。
對於人物,選擇一張清晰、光線均勻且未因極端鏡頭而變形的臉部圖片。若服裝也很重要,請納入足夠的身體範圍以呈現完整穿搭。對於產品,使用一張乾淨的商品照或真實產品照片,確保標誌、標籤、開合處、材質紋理及整體比例清晰可辨。對於場景,避免使用過於雜亂、導致預期建築線索不清楚的圖片。
除非對比效果是刻意為之,否則請勿將卡通角色參考圖與寫實風格的產品圖,以及高度風格化的油畫環境圖混用。提示詞不應被迫去解決一個無意間造成的風格衝突。
你也可以在生成前先於 Media.io 中準備好參考素材。例如,使用Image AI來建立或優化一張一致的參考圖片,再將核准好的素材帶入影片工作流程。
撰寫能區分固定元素與動作的素材提示詞
一個有效的 Veo 素材提示詞,能清楚區分哪些元素必須保持穩定,以及影片片段中應發生什麼動作。
從特徵與場景的固定元素開始描述:
「使用提供的女性作為同一角色、提供的紅色皮革斜背包作為確切產品,以及提供的飯店露台作為環境。保留包包的形狀、顏色、金色五金配件、提把長度與可見的標誌位置。」
接著描述動作與鏡頭運動:
「女性緩緩走在露台上,自然地將包包提在身側。她在欄杆旁停下,將包包朝向鏡頭轉動。鏡頭在腰部高度跟隨她移動,然後緩慢推近至以產品為主的中景畫面。溫暖的午後陽光,自然的布料與髮絲飄動。」
最後,僅在必要時添加音效提示。Veo 3.1 可以生成原生音效,因此提示詞中可以包含環境音、對話或音效細節。對於產品拍攝,簡單的環境音通常比複雜的音景更為適合。

使用多張參考圖片確保角色與產品的一致性
當影片同時需要呈現可識別的人物和可識別的產品時,多參考圖片生成特別有用。純文字提示詞可能只能產生正確類別的物件,但卻改變了細微的商業識別細節。素材圖片能為模型提供更具體的目標。
儘管如此,參考圖片的引導並不能在法律層面保證完全精確的複製。請將生成的品牌相關內容視為需要進行視覺 QA 的草稿。在完整解析度下仔細檢查標籤、標誌、包裝幾何形狀及產品顏色。如果產品旋轉時標誌變得無法辨識,可以考慮減少旋轉幅度、在獨立鏡頭中展示標籤,或在品牌識別最關鍵的時刻使用乾淨的產品靜態圖。
對於需要反覆出現的角色,請將素材參考與 Media.ioAI 影片一致性指南中更完整的規劃概念結合使用。透過重複使用已核准的參考素材、鏡頭邏輯、服裝定義和打光規則,而非為每個片段重新建立視覺規格,能有效提升一致性。
直接生成 9:16 原生直式影片,而非事後裁切橫式影片
Veo 3.1 素材功能的一項實用更新是原生 9:16 生成。這點非常重要,因為垂直構圖不只是裁切橫式畫面而已。一個在 16:9 畫面中構圖正確的角色,在裁切後可能會變得太小,或失去重要的手部動作與產品互動畫面。
在為 Shorts、Reels 或 TikTok 生成影片時,請針對垂直空間設計素材和提示詞:
- 將臉部與產品保持在畫面中央安全區域內。
- 留出足夠的頭部空間以便移動,同時避免畫面上方出現大片空白。
- 避免兩人之間的大範圍水平調度,除非兩者都能保持清晰可辨。
- 若稍後需要添加字幕或行動呼籲文字,請為畫面下方預留空間。
- 使用向前、向上或具有景深的運鏡,這類運動在直式螢幕上呈現效果更佳。
Media.io 也提供Veo 提示詞範例,可幫助你了解如何在模型提示詞中表達鏡頭語言與場景描述。

將對話與音效納入場景規劃
Veo 3.1 支援原生生成音效,Google 也已將音效功能帶入素材轉影片的工作流程。這意味著視覺參考規劃和音效規劃可以在同一次生成中完成。
對於對話,請確保台詞長度與片段時長相符。指定由誰在何時說話。如果角色在處理產品的同時說一句話,請避免同時要求多個戲劇性的鏡頭運動。同時添加的限制條件越多,產生失敗的可能性就越高。
對於環境音,描述那些屬於可見事件的聲音:露台上的輕柔海浪聲、杯子放在桌上的聲音、遠處的城市交通聲、布料摩擦聲或室內環境音。避免僅因為系統可以生成就添加音效。
當音效對最終剪輯至關重要時,請將音效與畫面分開聆聽檢查。確認語音清晰度、背景音的連續性、不自然的音樂變化,以及聲音是否在片段的邊界處出現不自然的起始或結束。
使用 1080p 和 4K 升解析度進行後製,而非修復錯誤的特徵辨識
請在升解析度之前先解決創意層面的問題。若產品形狀有誤,請使用更好的參考圖片或更簡單的動作重新生成。若臉部特徵出現變化,請減少相互衝突的輸入。若構圖不佳,請修正取景。升解析度應作為後製的最後步驟,在你已選出結構上正確的生成結果之後再進行。
建議的審查順序為:特徵辨識第一、動作第二、構圖第三、音效第四,最後才是解析度與後製。這能避免團隊花費時間在一個原本就應該被淘汰的片段上進行精修。

了解何時使用素材、首尾幀或單張圖片
這些控制選項各自解決不同的問題。
當你需要多張視覺參考來定義角色、物件、產品、材質或環境時,請使用「素材轉影片」。當開頭和結尾的狀態必須固定時,請使用首尾幀控制。當你希望以強烈的起始構圖為基礎、後續保有更大創作自由時,請使用單張初始圖片。
Veo 3.1 同時支援參考圖片和特定幀的生成控制,但這並不代表每個專案都應該同時使用所有控制選項。請選擇能針對最大風險的限制條件。
若產品特徵辨識是主要風險,請優先使用產品參考素材。若結尾必須停在精確的產品定格畫面,請優先設定最終幀。若你只需要從單張靜態圖片製作一段簡單的動態人像,單張圖片可能就已足夠。
修正 Veo 素材功能的常見問題
角色看起來相似但不完全一致
使用更清晰的特徵參考圖,排除風格衝突,並避免使用呈現差異過大的年齡、妝容、髮型或臉部角度的參考圖片。在相關片段中重複使用同一套已核准的參考素材組合。
產品在某些幀中正確,在其他幀中卻有誤
簡化互動方式,減少極端的旋轉和遮擋,並確保產品在畫面中佔有足夠大小以保持清晰可辨。必要時,將產品細節展示與複雜的角色動作分開處理。
場景主導了主體
你的環境參考圖可能視覺效果過於強烈,或提示詞過度強調了環境描述。請讓主體和動作的描述更加明確,並使用構圖語言賦予角色或產品更高的視覺優先級。
結果看起來像是參考圖片的拼貼
停止將每張參考圖片描述為獨立的物件列表。描述一個完整的場景,並說明各個素材在空間上是如何融為一體的。
直式影片感覺過於擁擠
在生成前就為 9:16 格式進行規劃。減少寬幅的左右並排調度,將重要的互動動作移至畫面中央。

使用 Media.io 製作並完成以素材為主導的影片
即使生成模型有所變更,Media.io 也能支援周邊的工作流程。請先準備好已核准的人物、產品和場景圖片,然後使用相關的 Veo 模型頁面或Video AI來測試視覺概念。記錄下哪套參考素材組合產生了已核准的結果,以避免未來的片段因意外使用不同的特徵素材包而從頭開始。
選出最佳影片後,繼續進行正常的剪輯、字幕添加、尺寸調整或額外場景製作。對於製作團隊而言,參考素材組合應被視為可重複使用的創意資產,而非用完即丟的提示詞附件。
Veo 3.1 素材功能 QA 檢查清單
在匯出前,請確認:
- 每張參考圖片都有明確定義的用途。
- 角色的外觀在整個片段中保持穩定。
- 產品的外形、包裝、顏色及重要細節均保持正確。
- 環境能夠烘托主體,而非喧賓奪主。
- 提示詞將固定的視覺事實與動作及鏡頭運動分開描述。
- 9:16 的構圖是以垂直方式設計,而非事後裁切而成。
- 對白符合片段長度,且說話的角色正確無誤。
- 音效氛圍與畫面中的事件相符。
- 僅在創作成果通過品質審核後,才進行升解析度處理。

關於 Veo 3.1 素材轉影片的常見問題
-
什麼是 Veo 3.1 的「素材生成影片」功能?
這是一種參考圖像工作流程,讓您可以透過重要視覺元素的圖像(例如人物、角色、產品、物件、紋理或場景)來引導 Veo 生成影片。
-
Veo 3.1 最多可以使用幾張參考圖像?
根據 Google 目前的 Gemini API 說明文件,Veo 3.1 最多可接受三張參考圖像,用於引導生成的影片內容。
-
Veo 3.1 能保持產品外觀的一致性嗎?
參考圖像有助於保留產品外觀,但生成的內容仍應仔細檢查標誌、標籤、幾何形狀、顏色及材質。商業用途的精確度需要進行品質審核。
-
「素材生成影片」支援垂直影片嗎?
支援。Google 已為 Veo 3.1「素材生成影片」新增原生 9:16 輸出功能,適用於 Shorts 及其他以行動裝置為主的格式。
-
Veo 3.1 能在參考圖像影片中生成音訊嗎?
可以。Google 已在「素材生成影片」及其他 Veo 3.1 以圖像為基礎的工作流程中新增音訊生成功能。請將音訊提示詞聚焦於對白及能夠烘托畫面場景的音效。
-
我應該使用「素材生成影片」還是「首尾幀」功能?
當多個視覺元素必須保持清晰可辨時,請使用「素材生成影片」。當確切的開始與結束狀態最為重要時,請使用「首尾幀」。選擇哪種控制方式,取決於該鏡頭中最主要的不確定來源。