Guía completa de generación de audio con Veo 3: cómo hacer que tus videos con IA tengan voz y música automáticamente (con plantillas de prompts)

Veo 3 no añade sonido a los videos de forma automática. Aunque escribas en el prompt "A woman says: 'Hello'", si no eliges el modo de calidad correcto o la descripción de audio no es lo bastante clara, el resultado será un video mudo.
Cuando Google presentó Veo 3 en I/O 2025, uno de sus argumentos de venta era el soporte de audio nativo: diálogo, efectos de sonido y música de fondo pueden generarse sincronizados con la imagen. Pero esa capacidad no viene activada por defecto; debes indicar en el prompt quién dice qué, qué sonidos hay en la escena y, en diálogos con varias personas, quién habla primero. La sincronización labial en diálogo individual ronda el 80%; con varios personajes baja por debajo del 40%, y en chino apenas alcanza el 30%.
Este artículo desglosa la lógica completa de la generación de audio en Veo 3, ofrece plantillas de prompts para diálogo, efectos y música, y métodos de diagnóstico para 5 problemas frecuentes.
La revolución del audio en Veo 3: adiós a los videos mudos
Qué es la generación de audio nativa
El flujo tradicional de generación de video con IA era así: primero se genera la imagen, y luego toca buscar actores de doblaje, grabar, crear efectos y mezclar. Según los cálculos del equipo de Promise Studios, el proceso completo lleva de media 4 horas.
Veo 3 lo comprime a 3 minutos.
Usa una «arquitectura dual-stream» (suena técnico, pero en la práctica significa que video y audio se generan a la vez y se alinean automáticamente). Introduces un prompt y la IA dibuja la escena mientras asigna el sonido: cuando un personaje habla, labios y voz van sincronizados de forma natural; el ambiente sonoro encaja con la imagen — llueve y hay sonido de lluvia, caminas sobre madera y se oyen pasos.
Pero hay un punto clave: la capacidad de audio de Veo 3 se divide en tres tipos. Hay que distinguirlos para usarla bien:
1. Diálogo (Dialogue)
Lo que dice un personaje o un narrador. Puedes controlar tono, acento y emoción.
2. Efectos de sonido (Sound Effects)
Sonidos concretos de la escena: un teléfono sonando, agua salpicando, una puerta que se abre con un chirrido.
3. Sonido ambiente (Ambient Noise)
El fondo que hace creíble la escena: tráfico urbano, olas en la orilla, el zumbido del aire acondicionado en una oficina.
Mejoras de audio en Veo 3.1 (octubre 2025)
El 14 de octubre de 2025, Google lanzó Veo 3.1 con una mejora notable en calidad de audio.
Lo probé yo mismo: en Veo 3, el diálogo a veces «flotaba» — la voz y los labios iban medio compás desfasados. Veo 3.1 corrige eso en gran medida y ahora admite diálogo con varias personas: dos personajes hablan por turnos sin mezclarse.
Otra actualización útil: antes solo el modo texto a video podía llevar audio; ahora también lo soportan imagen a video (subir una imagen y generar video), extensión de fotogramas (alargar la duración) y funciones similares.
Aun así, conviene ser claro: el audio de Veo 3.1 se parece más a un «first draft» (borrador). La comunidad indica que la naturalidad puede alcanzar el 92% de una grabación humana, pero para proyectos profesionales aún hará falta pulir en postproducción. A $0.75 por segundo, usarlo directamente como pieza final es arriesgado.
Principios clave de los prompts de audio: la claridad es lo que funciona
Por qué se generan videos sin sonido
Cuando empecé con Veo 3, alrededor del 70% de mis videos salían mudos. No era que la IA fallara: mis prompts eran demasiado vagos.
Veo 3 tiene una lógica de diseño: no añade audio por iniciativa propia. Si no lo pides, asume que quieres un video mudo.
Por ejemplo, si escribes: “A woman walking in the rain.”
Veo 3 generará fielmente a una mujer caminando bajo la lluvia — pero sin sonido de lluvia, sin pasos, nada.
Debes cambiarlo a: “A woman walking in the rain. Audio: rain pattering on pavement, footsteps splashing through puddles.”
Así entiende que quieres lluvia y pasos.
Otro detalle: si usas Veo 3 en Flow, recuerda poner el modo de calidad en “Highest Quality”. El modo de vista previa por defecto no genera audio. Yo caí en esa trampa: probé diez veces sin sonido hasta descubrir que era un problema de configuración.
Estrategias de prompt para los tres tipos de audio
Vamos al grano: cómo escribir prompts de audio.
Diálogo (Dialogue): formato fijo, mejor resultado
La fórmula es simple: descripción del personaje + acción + diálogo entre comillas
❌ Ejemplo incorrecto:
“A woman says hello.” (demasiado vago; la IA no sabe qué decir exactamente)
✅ Ejemplo correcto:
“The woman smiles and says, ‘Welcome to Veo 3.’”
Para controlar el tono, añade modificadores emocionales:
- angrily (con ira)
- nervously (con nerviosismo)
- softly (en voz baja)
- excitedly (con entusiasmo)
Ejemplo completo:
“The man leans forward and says angrily, ‘Where is my coffee?’”
Efectos de sonido (Sound Effects): acción + descripción del sonido
Este tipo de prompt debe ser concreto en los detalles del sonido.
❌ Ejemplo vago:
“a phone” (la IA no sabe qué hace el teléfono)
✅ Ejemplo concreto:
“the sound of a phone ringing”
“water splashing in the background”
“soft house sounds, the creak of a closet door, and a ticking clock”
Un truco: vincula el efecto a la acción visual con palabras como “as” o “when”.
“As the door creaks open, a gust of wind rushes in.”
Así queda clara la relación causa-efecto entre sonido e imagen.
Sonido ambiente (Ambient Noise): escena + capas de fondo
El ambiente debe describir «capas»; si no, suena plano.
❌ Ejemplo pobre:
“city sounds” (demasiado genérico)
✅ Ejemplo con capas:
“the sounds of city traffic and distant sirens” (tráfico cercano + sirenas lejanas)
“waves crashing on the shore” (efecto principal)
“the quiet hum of an office” (ruido de fondo)
Técnicas de descripción de audio espacial
Es una técnica avanzada, pero muy útil.
El oído humano percibe dirección: lo cercano suena nítido, lo lejano, apagado. Veo 3 también lo entiende, pero hay que decírselo.
Usa estas palabras para la relación espacial:
- in the distance (a lo lejos)
- cuts through (corta el fondo; indica efecto principal)
- somewhere above (en algún sitio arriba)
- faintly (débilmente)
- echoing (con eco)
Ejemplo completo (me funcionó muy bien en pruebas):
Rain falls steadily onto wet pavement, pattering softly across rooftops and metal bins.
A single, low thunderclap rolls across the sky, echoing faintly between tall buildings.
A car passes faintly in the distance. A dog barks once.
A soft, tense melody plays from an old radio somewhere above.
Aquí tienes:
- Efecto principal en primer plano: lluvia en el suelo
- Apoyo en plano medio: trueno que resuena a lo lejos
- Fondo lejano: un coche que pasa, un perro que ladra una vez
- Atmósfera: una radio antigua en algún piso de arriba
Con descripciones de audio en capas así, Veo 3 interpreta muy bien.
Diálogo en la práctica: haz que los personajes hablen
Mejores prácticas para diálogo individual
El diálogo es la parte más difícil del audio en Veo 3. No por la técnica en sí, sino por las reglas.
Primera regla de hierro: el diálogo debe ser corto, una frase, dentro de 8 segundos.
Probé hacer que un personaje dijera un párrafo largo: o perdía líneas o los labios se desincronizaban. Veo 3 aún no es estable con diálogos largos. O divides en varios fragmentos o te quedas en una sola frase.
Segunda regla: emoción + acción + lenguaje, los tres juntos.
❌ Ejemplo plano:
“He says, ‘Did you hear that?’”
✅ Ejemplo con tensión:
“He bursts into wild laughter, head thrown back. Mid-laugh, he stops, eyes widening in terror, then whispers softly: ‘Did you hear that?’”
¿Ves la diferencia? El segundo describe el cambio emocional: risa → parada brusca → miedo → susurro. Veo 3 puede generar ese giro y el resultado suena muy real.
Tercera: la consistencia del personaje importa.
Si generas varios fragmentos, usa siempre la misma descripción del personaje. Por ejemplo, “a woman in a red coat with short black hair” debe repetirse idéntica en cada prompt; si no, la IA creará personajes distintos y la voz cambiará.
Trucos para diálogo con varios personajes
Dos personas hablando a la vez es la pesadilla del audio en Veo 3.
Probé escribir un guion directo así:
Man: "What are you doing?"
Woman: "None of your business."
El resultado fue desastroso: o solo una tenía voz, o el diálogo no encajaba con la imagen.
La forma correcta: no escribas guion de diálogo; escribe flujo de escena.
✅ Ejemplo que funciona:
“Inside a cluttered garage, two teenage friends argue over a broken time machine. One leans over the table, frustrated and loud. The other avoids eye contact, mumbling and fiddling with wires. Rain hits the roof, and the lights flicker.”
La lógica: que la IA entienda que «dos personas discuten», no que le digas «A dice esto, B dice aquello». Veo 3 decide cuándo y cómo habla cada uno.
Aun así, el éxito en diálogo con varios personajes sigue siendo menor que en individual. Para conversaciones complejas, conviene que solo hable una persona por fragmento y unir en postproducción.
Optimizar la sincronización labial
Los labios desfasados son el problema más habitual en diálogo.
Tres recomendaciones:
1. Un solo personaje hablando por fragmento
Ya lo dijimos, pero merece repetirse: varios hablantes a la vez desordenan la sincronización.
2. Descripciones explícitas de turnos
Si necesitas varios personajes, indica quién habla primero y quién después.
“The woman speaks first, then pauses. The man nods and replies.”
3. Añade “No subtitles.”
Mucha gente no lo sabe: Veo 3 a veces genera subtítulos sobre la imagen y tapan la boca. “No subtitles.” desactiva esa función.
Diferencias entre diálogo en chino e inglés
Una realidad incómoda: el diálogo en chino funciona mucho peor que en inglés.
Probé más de veinte prompts en chino; el éxito no llegaba al 30%. Problemas habituales:
- Líneas perdidas: escribes tres frases y solo sale una
- Confusión de hablante: dice A pero se mueven los labios de B
- Acento raro: el mandarín suena robótico
En inglés va mucho mejor: en la misma escena, los prompts en inglés superan el 70% de éxito.
Alternativa: diálogo central en inglés, descripción de escena puede ir en chino.
Por ejemplo:
“一个穿红色外套的女人走进咖啡馆,微笑着对服务员说:‘One cappuccino, please.’” (escena en chino, diálogo en inglés)
Así entiendes el prompt y el diálogo no pierde calidad.
Efectos de sonido y música: una experiencia inmersiva
Diseño en capas de los efectos de sonido
Más efectos no siempre es mejor. Demasiados sonidos y todo suena confuso.
Mi experiencia: tres capas, con prioridades claras.
Primer plano (Foreground) — efectos de acción principal
Donde va la atención del espectador. Puerta que se abre, vaso que se rompe, pasos: deben sonar nítidos y fuertes.
Plano medio (Midground) — ambiente auxiliar
No compite con el efecto principal, pero añade realismo. Por ejemplo, el silbido de la máquina de espresso o murmullos de clientes en una cafetería.
Fondo (Background) — música de atmósfera
Sonido de base que marca el tono emocional. Jazz suave, tráfico lejano.
Ejemplo completo (escena de cafetería):
Audio: espresso machine hissing (foreground), soft jazz music (background),
customers chatting quietly (midground). The barista says: "One cappuccino coming right up!"
Indica las capas entre paréntesis; Veo 3 lo interpreta mejor. Sin marcarlas, a veces la música de fondo queda demasiado alta y tapa el diálogo.
Control emocional de la música de fondo
La música de fondo es fácil de pasar por alto, pero es muy importante.
Tipos de música que debes nombrar con claridad:
- jazz
- classical
- electronic
- ambient
- upbeat
Modificadores de emoción:
- tense (tenso)
- upbeat (alegre)
- melancholic (melancólico)
- mysterious (misterioso)
Ejemplos concretos:
- “A soft, tense melody plays” (melodía suave pero tensa)
- “Upbeat festival music with steady drums” (música festiva alegre con batería constante)
Un detalle que muchos ignoran: el tempo (ritmo) también se puede controlar.
- slow tempo → escenas tristes o de recuerdo
- fast tempo → acción o persecución
Evitar conflictos de audio
Este fue el mayor error que cometí al principio.
Pensaba que cuantos más efectos, más realismo. En un clip de 5 segundos metí lluvia, trueno, pasos, tráfico, diálogo y música de fondo — seis capas de audio.
El resultado sonaba a sopa: no se entendía nada.
Aprendí la lección: máximo 3-4 capas de audio por fragmento, con prioridades claras.
Marca la prioridad con modificadores de volumen:
- loud (fuerte) → efecto principal en primer plano
- soft (suave) → música de fondo
- faint (débil) → ambiente lejano
- dominating (dominante) → efecto central
Ejemplo:
“Loud thunder crashes (dominating). Rain patters softly on the roof (background). A car engine starts faintly in the distance.”
Así Veo 3 sabe: el trueno es el protagonista, la lluvia queda de fondo y el coche es un detalle.
Diagnóstico: soluciones a 5 problemas frecuentes de audio
Problema 1: el video generado no tiene sonido
Es el más común; alrededor del 85% de los «videos mudos» se deben a estas tres causas.
Causa 1: no especificaste audio en el prompt
Revisa si tu prompt incluye “Audio:”, “says” o diálogo entre comillas. Sin eso, Veo 3 asume video mudo.
Solución:
- Describe el audio en una frase aparte: “Audio includes…”
- Envuelve el diálogo entre comillas: “The man says, ‘Hello.’”
- Si hace falta, añade: “Please generate this with clear speech.”
Causa 2: modo de calidad incorrecto
En Flow hay dos modos: Preview (vista previa) y Highest Quality (máxima calidad). La vista previa no genera audio.
Solución:
Abre Flow → icono de configuración → elige “Highest Quality”
Causa 3: la descripción de audio queda enterrada
Si el prompt tiene 300 palabras de imagen y al final añades “with dialogue”, Veo 3 puede ignorar las instrucciones de audio.
Solución:
Coloca las instrucciones de audio al principio, en la primera mitad del prompt.
Problema 2: diálogo y labios desincronizados
Labios que «flotan», voz medio compás adelantada — muy habitual en diálogo con varios personajes.
Causa raíz: la IA se confunde al procesar varios hablantes a la vez.
Solución:
- Divide en fragmentos: en cada clip de 8 segundos, solo una persona habla; une después
- Acorta el diálogo: una frase en menos de 5 segundos
- Usa descripciones de turnos: “The woman speaks first, pauses, then the man responds.”
En mis pruebas, el diálogo individual llega al 80% de sincronización labial; con varios personajes, solo al 40%. Si la sincronización es crítica, no fuerces diálogo multi-personaje.
Problema 3: calidad de audio baja o poco natural
Voz que «flota», sonido mecánico, efecto de robot.
Causa: prompt demasiado vago, sin rasgos de voz.
Si escribes “A man speaks”, la IA no sabe si la voz es grave, aguda o ronca. Sin información, genera una «voz masculina media».
Solución:
-
Añade rasgos de voz
- clear (clara)
- raspy (ronca)
- sharp (aguda)
- deep (grave)
-
Describe la reverberación del entorno
- indoor reverb (interior)
- outdoor, open space (exterior, espacio abierto)
- echoing space (espacio con eco)
-
Indica acento y ritmo (para diálogo en inglés)
- British accent (acento británico)
- slow, deliberate pace (ritmo lento y pausado)
Ejemplo completo:
“A man with a deep, raspy voice speaks slowly in an indoor space: ‘Welcome home.’”
Problema 4: efectos de sonido que no encajan con la imagen
El personaje camina sobre madera pero suena a piedra. O el sonido de la puerta llega un segundo antes que en pantalla.
Causa: la descripción del sonido no está ligada a la escena visual.
Solución:
Describe imagen y audio en la misma frase, conectados por palabras causales.
❌ Descripciones separadas:
“A door opens. There is a creaking sound.”
✅ Descripción vinculada:
“As the door creaks open, a gust of wind rushes in.”
Palabras para establecer causa-efecto:
- as (cuando)
- when (cuando)
- while (mientras)
- making (haciendo / produciendo)
Ejemplo:
“She walks across the wooden floor, her heels clicking sharply with each step.”
Problema 5: la música de fondo tapa el diálogo o los efectos
Muy frustrante: diseñas un diálogo cuidadoso y la música lo cubre por completo.
Causa: no definiste capas ni relación de volumen.
Solución:
Marca con modificadores de volumen quién es el protagonista.
❌ Sin capas:
“Background music plays. The woman says, ‘Hello.’”
✅ Con capas claras:
“Soft background music plays quietly. The woman’s voice cuts through clearly: ‘Hello.’”
Palabras clave:
- soft background music (música de fondo suave)
- loud foreground dialogue (diálogo fuerte en primer plano)
- voice cuts through (la voz corta el fondo)
- music fades into background (la música se retira al fondo)
Otro truco: si el diálogo es lo importante, no añadas música de fondo. Bruto, pero efectivo.
Técnicas avanzadas: sube la tasa de éxito del audio
Usar un generador de prompts para Veo 3
Escribir prompts a mano hace fácil olvidar detalles. Hay una forma más cómoda: usar un generador.
Dos herramientas gratuitas recomendadas:
-
prompt-helper.com/veo-3-prompt-generator
Sin registro: introduces la escena y genera un prompt completo con instrucciones de audio. -
Generador oficial de prompts de Veo 3.1 de Google
Integrado en el editor de Flow; sugiere elementos de audio según tu escena.
Para escenas complejas suelo partir del generador y ajustar a mano. Ahorra bastante tiempo.
Estrategia de control de costes
El modelo de precios de Veo 3: $0.75/segundo.
Un video de 8 segundos son $6; un minuto, $45. Si pruebas cinco o seis veces, el gasto sube rápido.
Trucos para ahorrar:
1. Prueba primero en modo de baja calidad
Flow tiene modo “Draft”: genera rápido y barato, pero sin audio.
Sirve para probar composición; cuando esté bien, renderiza con Highest Quality para obtener audio.
2. Acorta la duración
No generes 60 segundos de entrada. Empieza con fragmentos de 5-8 segundos; cuando el audio convenza, alarga.
3. Usa la función “Extend”
Extend de Veo 3.1 alarga un video existente a menor precio que regenerar. Ahora también continúa el audio.
Ajustes de postproducción en el editor Flow
Veo 3.1 está muy integrado con Flow; algunos problemas de audio se pueden corregir después.
Ajustes posibles en post:
- Balance de volumen: si la música de fondo es muy alta, baja el nivel con las herramientas de audio de Flow
- Unión de fragmentos: combina varios clips de diálogo individual en una conversación completa — más fiable que generar multi-personaje de una vez
- Reemplazo de audio: conserva la imagen y cambia solo la pista de sonido (va contra el espíritu del «audio nativo», pero salva situaciones)
Extend en Flow es especialmente útil:
Generas un video de 8 segundos con audio y lo alargas a 15 con Extend; el audio continúa de forma natural. Mucho más fiable que regenerar 15 segundos de cero.
Aun así, la edición de audio en Flow sigue siendo básica. Para postproducción profesional, exporta a Premiere o Final Cut.
Conclusión
En resumen, tres ideas:
Especifica el audio con claridad — Veo 3 no lo inventa; debes decir qué sonidos quieres.
Diseña en capas — diálogo, efectos y música de fondo con prioridades; no amontones.
Frases cortas — diálogo dentro de 8 segundos; una sola persona hablando cada vez.
La generación de audio en Veo 3 requiere varias pruebas hasta pillar el ritmo. Yo tiré unos 20 videos de prueba antes de entender las reglas. Pero una vez dominado, la eficiencia de creación se multiplica: un flujo tradicional de 4 horas de doblaje, ahora en 3 minutos.
El soporte en chino de Veo 3.1 aún no es ideal y la sincronización en diálogo con varios personajes tiene margen de mejora, pero ya es un gran paso en generación de video. Google dice que Veo 3 sigue iterando rápido; es probable que el año que viene muchos de estos problemas mejoren.
Empieza ya:
- Abre Veo 3 y elige el modo Highest Quality
- Copia una plantilla de este artículo y adáptala a tu escena
- Genera tu primer video con IA que lleve audio
Si algo falla, vuelve al capítulo de diagnóstico de este artículo. Generar audio es cuestión de técnica, no de magia negra. Con unas pruebas, lo pillarás.
FAQ
¿Por qué el video generado con Veo 3 no tiene sonido?
1) No especificaste audio en el prompt:
• Debe incluir Audio:, says, diálogo entre comillas, etc.
2) Modo de calidad incorrecto:
• Debes elegir Highest Quality
• El modo de vista previa no genera audio
3) La descripción de audio queda enterrada:
• Coloca las instrucciones de audio en la primera mitad del prompt
¿Cómo hacer que un personaje hable?
Ejemplo: 'The woman smiles and says, "Welcome to Veo 3."'
Notas:
• Diálogos cortos, dentro de 8 segundos
• Puedes añadir modificadores de tono (angrily, softly, excitedly) para controlar la emoción
¿Qué hacer si el diálogo y los labios no están sincronizados?
1) Divide en fragmentos: en cada clip de 8 segundos, solo una persona habla
2) Acorta el diálogo: una frase en menos de 5 segundos
3) Usa descripciones explícitas de turnos
Comparación de éxito:
• Diálogo individual: 80% de sincronización labial
• Varios personajes: solo 40%
¿Cómo añadir efectos de sonido y música de fondo?
• Efectos de sonido con SFX
• Sonido ambiente con Ambient
Diseño en tres capas:
• Primer plano (efectos de acción principal)
• Plano medio (ambiente auxiliar)
• Fondo (música de atmósfera)
Trucos:
• Indica las capas entre paréntesis
• Usa modificadores de volumen (loud, soft, faint) para marcar prioridades
• Máximo 3-4 capas de audio por fragmento
¿Por qué el diálogo en chino funciona peor que en inglés?
• Líneas perdidas
• Confusión sobre quién habla
• Acento extraño
Los prompts en inglés superan el 70% de éxito.
Alternativa: diálogo central en inglés, descripción de escena en chino
Ejemplo: '一个穿红色外套的女人走进咖啡馆,微笑着对服务员说:"One cappuccino, please."'
¿Cómo controlar el coste del audio?
1) Prueba primero la composición en modo Draft; cuando esté bien, renderiza con Highest Quality para obtener audio
2) Acorta la duración: empieza con fragmentos de prueba de 5-8 segundos
3) Usa Extend para alargar un video existente — más barato que regenerar
Veo 3 cobra $0.75/segundo; un video de 8 segundos cuesta $6.
17 min de lectura · Publicado el: 7 dic 2025 · Actualizado el: 21 ago 2026
Guía de Veo3
Si llegaste desde búsqueda, lo más rápido es ir al artículo anterior o siguiente de esta misma serie.
Anterior
Control de movimiento de cámara en Veo 3: 7 lenguajes de plano para que tus videos con IA parezcan cine
Domina dolly shot, tracking shot y otros 7 tipos de movimiento de cámara en tus prompts para que los videos con Veo 3 ganen al instante sensación cinematográfica. Incluye plantillas listas para usar y guía de errores comunes, ideal para quienes empiezan en creación de video con IA.
Parte 3 de 9
Siguiente
Guía completa de consistencia de personajes en Veo 3: videos multiplano coherentes con Scenebuilder
Aprende a resolver la inconsistencia de personajes en videos multiplano con Scenebuilder de Veo 3. Incluye pasos completos, plantillas de prompts y trucos prácticos para mantener la apariencia estable en cada toma.
Parte 5 de 9



Comentarios
Inicia sesión con GitHub para dejar un comentario