Tres imágenes de referencia solo ayudan cuando cada una tiene una función.Veo 3.1 Ingredients to Video no se trata tanto de subir más imágenes, sino de separar las señales de identidad, producto y entorno para que el modelo no tenga que adivinar qué detalles importan.
La demostración oficial de Google DeepMind es un primer vistazo útil a esa idea. Muestra múltiples referencias que guían los personajes, objetos y el estilo de una escena generada, en lugar de obligar a una sola imagen a definirlo todo.
| Referencia | Mejor función |
|---|---|
| Personaje | Identidad del rostro, cabello, atuendo y cuerpo |
| Producto u objeto | Forma, materiales, empaque y detalles reconocibles |
| Escena o estilo | Entorno, dirección de iluminación y lenguaje visual |
En este artículo
- Qué cuenta como ingrediente en Veo 3.1
- Asigna a cada referencia una función clara
- Prepara las imágenes de referencia antes de generar
- Escribe un prompt de ingredientes que separe las invariantes de la acción
- Usa múltiples referencias para la consistencia de personajes y productos
- Genera video nativo en 9:16 en lugar de recortar el formato panorámico después
- Planifica el diálogo y el audio como parte de la escena
- Usa el escalado a 1080p y 4K para el acabado, no para corregir una identidad deficiente
- Sabe cuándo usar ingredientes, primero y último fotograma, o una sola imagen
- Corrige los fallos comunes de Veo Ingredients
- Crea y finaliza un video basado en ingredientes con Media.io
- Lista de verificación de control de calidad de Veo 3.1 Ingredients
- Preguntas frecuentes sobre Veo 3.1 Ingredients to Video
Qué cuenta como ingrediente en Veo 3.1
Un ingrediente es una imagen de referencia que le indica al modelo cómo debe verse un elemento visual importante. Es diferente de una imagen inicial que se convierte en el primer fotograma. Una imagen de referencia puede guiar el contenido sin obligar a que todo el fotograma generado copie su composición.
Un conjunto de ingredientes práctico podría incluir:
- Una referencia de personaje con un rostro y atuendo claramente definidos.
- Una referencia de producto con forma, empaque y materiales legibles.
- Una referencia de ubicación o estilo que defina el entorno o el lenguaje visual.
También puedes usar varias imágenes del mismo sujeto cuando la identidad es el principal desafío, pero recuerda que la API actualmente permite hasta tres imágenes de referencia. El conjunto debe estar cuidadosamente seleccionado.
Si tu objetivo es simplemente animar desde una sola imagen estática en lugar de usar control con múltiples referencias, un flujo de trabajo estándar de imagen a video puede ser más rápido. Los ingredientes se vuelven valiosos cuando varios elementos visuales necesitan mantenerse juntos durante la generación.
Asigna a cada referencia una función clara
La forma más sencilla de crear un paquete de referencias confuso es subir tres imágenes hermosas que cada una implique una escena diferente. En cambio, anota la función de cada imagen antes de subirla.

Para un video de producto de moda, los roles podrían ser:
- Identidad del personaje: el rostro, el cabello y las proporciones corporales del modelo.
- Identidad del producto: el bolso exacto, incluyendo forma, asas, herrajes y color.
- Entorno: una terraza de hotel mediterráneo con luz solar, piedra clara y el mar de fondo.
Ahora el prompt de texto puede centrarse en la acción: el personaje camina por la terraza llevando el bolso, se gira hacia la cámara, apoya una mano en la barandilla, y la cámara pasa de un plano medio de seguimiento a un plano más cercano centrado en el producto.
Eso es más limpio que usar tres fotos de estilo de vida donde la persona, el bolso, el fondo y la iluminación cambian de imagen en imagen.

Prepara las imágenes de referencia antes de generar
La calidad de la referencia afecta lo que el modelo tiene que inferir. Usa imágenes donde el sujeto importante sea lo suficientemente grande para examinarlo y no esté oculto por efectos excesivos.
Para personas, elige un rostro nítido, con iluminación uniforme y no distorsionado por un objetivo extremo. Si el vestuario importa, incluye suficiente parte del cuerpo para mostrarlo. Para productos, usa una fotografía limpia de producto o una foto realista donde el logotipo, la etiqueta, los cierres, la textura y las proporciones generales sean legibles. Para una ubicación, evita una imagen tan saturada que las referencias arquitectónicas previstas sean poco claras.
No mezcles una referencia de personaje de dibujos animados con un producto fotorrealista y un entorno de pintura al óleo muy estilizado, a menos que ese contraste sea intencional. El prompt no debería tener que resolver un conflicto de estilo accidental.
También puedes preparar referencias en Media.io antes de la generación. Por ejemplo, usa Image AI para crear o perfeccionar una imagen de referencia consistente, y luego lleva el recurso aprobado al flujo de trabajo de video.
Escribe un prompt de ingredientes que separe las invariantes de la acción
Un prompt sólido de Veo Ingredients distingue entre lo que debe mantenerse estable y lo que debe suceder durante el clip.
Comienza con las invariantes de identidad y escena:
"Usa a la mujer proporcionada como el mismo personaje, el bolso de cuero rojo proporcionado como el producto exacto, y la terraza del hotel proporcionada como el entorno. Conserva la forma del bolso, el color, los herrajes dorados, la longitud del asa y la ubicación visible del logotipo."
Luego describe la acción y la cámara:
"La mujer camina lentamente por la terraza, llevando el bolso de forma natural a su lado. Se detiene cerca de la barandilla y gira el bolso hacia la cámara. La cámara la sigue a la altura de la cintura y luego hace un lento acercamiento hacia un plano medio centrado en el producto. Luz solar cálida de última hora de la tarde, movimiento natural de la tela y el cabello."
Finalmente, añade señales de audio solo cuando sea necesario. Veo 3.1 puede generar audio nativo, por lo que un prompt puede incluir ambiente, diálogo o detalles de sonido. Para una toma de producto, un ambiente sencillo puede ser mejor que un paisaje sonoro saturado.

Usa múltiples referencias para la consistencia de personajes y productos
La generación con múltiples referencias es especialmente útil cuando el video necesita tanto una persona reconocible como un producto reconocible. Un prompt solo de texto puede producir la categoría correcta de objeto mientras cambia pequeños detalles comerciales. Una imagen de ingrediente le da al modelo un objetivo más concreto.
Aun así, la guía de referencia no es una garantía legal de reproducción exacta. Trata el contenido de marca generado como un borrador que requiere control de calidad visual. Verifica etiquetas, logotipos, geometría del empaque y color del producto a resolución completa. Si un logotipo se vuelve ilegible cuando el producto rota, reduce la rotación, muestra la etiqueta en una toma separada o usa una imagen limpia del producto durante el momento más sensible para la marca.
Para personajes recurrentes, combina las referencias de ingredientes con las ideas de planificación más amplias de la guía de consistencia de video con IA de Media.io. La consistencia mejora cuando reutilizas referencias aprobadas, lógica de cámara, definiciones de vestuario y reglas de iluminación, en lugar de crear una nueva especificación visual para cada clip.
Genera video nativo en 9:16 en lugar de recortar el formato panorámico después
Una de las actualizaciones útiles de Veo 3.1 Ingredients es la generación nativa en 9:16. Esto importa porque la composición vertical no es simplemente un recorte del formato panorámico. Un personaje enmarcado correctamente para 16:9 puede quedar demasiado pequeño o perder acciones importantes de manos y producto tras el recorte.
Al generar para Shorts, Reels o TikTok, diseña los ingredientes y el prompt para el espacio vertical:
- Mantén el rostro y el producto dentro del área central segura.
- Deja suficiente espacio en la parte superior para el movimiento sin crear una mitad superior vacía.
- Evita el bloqueo horizontal amplio entre dos personas a menos que ambas puedan permanecer legibles.
- Reserva espacio en la parte inferior de la pantalla si se añadirán subtítulos o texto de llamada a la acción posteriormente.
- Usa movimiento hacia adelante, hacia arriba o en profundidad que se lea bien en una pantalla vertical.
Media.io también tiene ejemplos de prompts para Veo que pueden ayudarte a ver cómo se expresa el lenguaje de cámara y escena en los prompts del modelo.

Planifica el diálogo y el audio como parte de la escena
Veo 3.1 admite audio generado de forma nativa, y Google ha incorporado el audio a los flujos de trabajo de Ingredients to Video. Eso significa que la planificación visual de referencias y la planificación de audio pueden ocurrir en la misma generación.
Para el diálogo, mantén la línea hablada compatible con la duración del clip. Especifica quién habla y cuándo. Si el personaje dice una frase mientras maneja un producto, evita pedir también varios movimientos de cámara dramáticos. Cuantas más restricciones simultáneas añadas, más modos de fallo crearás.
Para el ambiente, describe sonidos que pertenezcan a eventos visibles: el suave oleaje del océano en la terraza, una taza colocada sobre una mesa, el tráfico lejano de la ciudad, el movimiento de la tela o el tono de la habitación. Evita añadir efectos de sonido simplemente porque el sistema puede generarlos.
Cuando el audio sea importante para la edición final, escúchalo por separado de la imagen. Verifica la claridad del habla, la continuidad del fondo, los cambios musicales no deseados y si el sonido comienza o termina de forma antinatural en los límites del clip.
Usa el escalado a 1080p y 4K para el acabado, no para corregir una identidad deficiente
Resuelve los problemas creativos antes de escalar la resolución. Si la forma del producto es incorrecta, regenera con mejores referencias o movimientos más simples. Si el rostro cambia, reduce las entradas conflictivas. Si la composición es débil, corrige el encuadre. El escalado debe ser el paso final después de haber seleccionado una generación estructuralmente correcta.
Un orden de revisión útil es: primero la identidad, luego el movimiento, después la composición, luego el audio y finalmente la resolución y el acabado. Esto evita que los equipos dediquen tiempo a perfeccionar un clip que debería haberse descartado antes.

Sabe cuándo usar ingredientes, primero y último fotograma, o una sola imagen
Estos controles resuelven problemas diferentes.
Usa Ingredients to Video cuando necesites varias referencias visuales para definir personajes, objetos, productos, texturas o entornos. Usa el primer y último fotograma cuando los estados de apertura y cierre deban ser fijos. Usa una imagen inicial cuando quieras una composición de inicio sólida con más libertad creativa a continuación.
Veo 3.1 admite tanto imágenes de referencia como generación específica por fotograma, pero eso no significa que cada proyecto deba usar todos los controles a la vez. Elige la restricción que apunte al mayor riesgo.
Si la identidad del producto es el riesgo, prioriza los ingredientes de referencia del producto. Si el final debe terminar en una toma precisa del producto, prioriza el fotograma final. Si solo necesitas un retrato animado simple a partir de una sola imagen, puede ser suficiente con una sola imagen.
Corrige los fallos comunes de Veo Ingredients
El personaje se parece pero no es idéntico
Usa una referencia de identidad más nítida, elimina los conflictos de estilo y evita referencias que muestren edades, maquillaje, peinados o ángulos faciales muy diferentes. Reutiliza el mismo conjunto de referencias aprobadas en clips relacionados.
El producto es correcto en un fotograma y está mal en otro
Simplifica la interacción, reduce la rotación extrema y la oclusión, y da al producto suficiente tamaño en pantalla para que permanezca legible. Separa el detalle del producto de la acción compleja del personaje cuando sea necesario.
La ubicación domina al sujeto
Es posible que tu referencia de entorno sea visualmente demasiado fuerte o que el prompt la enfatice en exceso. Haz que el sujeto y la acción sean más explícitos, y usa un lenguaje de encuadre que priorice al personaje o al producto.
El resultado parece un collage de las referencias
Deja de describir cada referencia como una lista de objetos separados. Describe una escena coherente y explica cómo los ingredientes se relacionan espacialmente entre sí.
El video vertical se siente oprimido
Planifica el formato 9:16 antes de la generación. Reduce la disposición amplia lado a lado y mueve las interacciones importantes hacia el centro del encuadre.

Crea y finaliza un video basado en ingredientes con Media.io
Media.io puede apoyar el flujo de trabajo circundante incluso cuando el modelo de generación cambia. Primero prepara tus imágenes aprobadas de persona, producto y escena. Luego usa la página del modelo Veo correspondiente o Video AI para probar el concepto visual. Mantén un registro de qué conjunto de referencias produjo el resultado aprobado para que los clips futuros no comiencen accidentalmente con un paquete de identidad diferente.
Después de seleccionar el mejor video, continúa con la edición normal, subtítulos, redimensionado o escenas adicionales. Para los equipos de producción, el conjunto de referencias debe tratarse como recursos creativos reutilizables, no como archivos adjuntos de prompt desechables.
Lista de verificación de control de calidad de Veo 3.1 Ingredients
Antes de exportar, confirma que:
- Cada imagen de referencia tiene un rol definido.
- La identidad del personaje se mantiene estable a lo largo del clip.
- La forma del producto, el embalaje, los colores y los detalles importantes permanecen correctos.
- El entorno complementa al sujeto en lugar de eclipsarlo.
- El prompt separa los datos visuales fijos de la acción y el movimiento de cámara.
- Las composiciones en 9:16 se diseñan verticalmente en lugar de recortarse posteriormente.
- El diálogo se ajusta a la duración del clip y el personaje correcto aparece hablando.
- El ambiente sonoro coincide con los eventos visibles.
- El escalado de resolución se aplica solo después de que el resultado creativo supera el control de calidad.

Preguntas frecuentes sobre Veo 3.1 Ingredients to Video
-
¿Qué es Veo 3.1 Ingredients to Video?
Es un flujo de trabajo basado en imágenes de referencia que permite guiar un video de Veo con imágenes de elementos visuales importantes, como una persona, personaje, producto, objeto, textura o escena.
-
¿Cuántas imágenes de referencia puede usar Veo 3.1?
La documentación actual de la API Gemini de Google indica que Veo 3.1 acepta hasta tres imágenes de referencia para guiar el contenido de video generado.
-
¿Puede Veo 3.1 mantener la coherencia de un producto?
Las imágenes de referencia pueden ayudar a preservar la apariencia del producto, pero el contenido generado debe seguir inspeccionándose en cuanto a logotipos, etiquetas, geometría, colores y materiales. La precisión comercial requiere control de calidad.
-
¿Ingredients to Video admite video vertical?
Sí. Google ha añadido salida nativa en 9:16 para Veo 3.1 Ingredients to Video, lo cual resulta útil para Shorts y otros formatos orientados a dispositivos móviles.
-
¿Puede Veo 3.1 generar audio con video basado en imágenes de referencia?
Sí. Google ha añadido audio generado a Ingredients to Video y otros flujos de trabajo basados en imágenes de Veo 3.1. Mantén los prompts de audio enfocados en diálogos y sonidos que complementen la escena visible.
-
¿Debo usar Ingredients to Video o fotogramas de inicio y fin?
Usa Ingredients cuando varios elementos visuales deben permanecer reconocibles. Usa fotogramas de inicio y fin cuando los estados exactos de inicio y final sean lo más importante. El control adecuado depende de la principal fuente de incertidumbre en la toma.



