Áudio no Veo 3: como gerar diálogos, efeitos e trilhas com IA

O Veo 3 não adiciona som automaticamente aos vídeos. Mesmo que o prompt contenha "A woman says: 'Hello'", o resultado será um vídeo mudo se o modo de qualidade estiver incorreto ou se a descrição do áudio não for clara o bastante.
Quando o Google apresentou o Veo 3 no I/O de 2025, um dos principais destaques foi o suporte nativo a áudio: diálogos, efeitos sonoros e música de fundo podem ser gerados em sincronia com as imagens. Esse recurso, porém, não vem ativado por padrão. O prompt precisa indicar quem fala, o que a pessoa diz, quais sons existem na cena e, em diálogos com várias pessoas, quem fala primeiro. A sincronização labial chega a cerca de 80% em diálogos com uma pessoa, cai para menos de 40% com várias pessoas e fica em apenas 30% para falas em chinês.
Este artigo explica toda a lógica da geração de áudio no Veo 3, traz modelos de prompt para diálogos, efeitos e trilhas, além de métodos para diagnosticar cinco problemas recorrentes.
A revolução do áudio no Veo 3: o fim dos vídeos mudos
O que é geração nativa de áudio
O processo tradicional de geração de vídeo com IA funciona assim: primeiro você cria as imagens; depois, precisa encontrar dubladores, gravar, produzir efeitos e mixar tudo. A equipe da Promise Studios calculou que o processo completo leva, em média, 4 horas.
O Veo 3 reduz esse trabalho a 3 minutos.
Ele usa uma “arquitetura dual-stream”. O nome parece técnico, mas significa apenas que vídeo e áudio são gerados ao mesmo tempo e alinhados automaticamente. Você fornece um prompt, e a IA cria as imagens enquanto produz os sons. Quando um personagem fala, os movimentos da boca e a voz já nascem sincronizados. Os sons ambientes também acompanham a cena: se chove, ouvimos a chuva; se alguém caminha sobre um piso de madeira, ouvimos os passos.
Há, porém, um detalhe essencial: os recursos de áudio do Veo 3 se dividem em três categorias. É preciso diferenciá-las para obter bons resultados:
1. Diálogo (Dialogue)
É o que um personagem ou narrador diz. Você pode controlar o tom, o sotaque e a emoção.
2. Efeitos sonoros (Sound Effects)
São sons específicos que acontecem na cena: o telefone tocando, a água espirrando ou uma porta abrindo com um rangido.
3. Som ambiente (Ambient Noise)
É o áudio de fundo que torna a cena verossímil: o trânsito da cidade, as ondas quebrando na praia ou o zumbido do ar-condicionado no escritório.
A atualização de áudio do Veo 3.1 em outubro de 2025
Em 14 de outubro de 2025, o Google lançou o Veo 3.1, com uma melhora perceptível na qualidade do áudio.
Nos meus próprios testes comparativos, os diálogos gerados pelo Veo 3 às vezes pareciam “flutuar”: a voz ficava uma fração de segundo fora de sincronia com a boca. O Veo 3.1 praticamente resolveu esse problema e agora também oferece suporte a diálogos com várias pessoas: dois personagens podem falar em turnos sem que as vozes se confundam.
Outra atualização bastante útil é que, antes, somente o recurso de “texto para vídeo” aceitava áudio. Agora, recursos como “Ingredients to Video” (gerar um vídeo a partir de imagens enviadas) e “Frame Extension” (aumentar a duração do vídeo) também oferecem suporte a áudio.
Ainda assim, é importante deixar claro que o áudio gerado pelo Veo 3.1 se parece mais com um “first draft”, ou seja, uma primeira versão. Segundo relatos da comunidade, a naturalidade pode chegar a 92% de uma gravação humana. Em um projeto profissional, porém, ainda vale fazer um acabamento posterior. Afinal, cada segundo de vídeo custa US$ 0,75; usar o primeiro resultado como produto final é arriscado.
Princípio básico dos prompts de áudio: seja explícito
Por que o vídeo sai sem som
Quando comecei a usar o Veo 3, cerca de 70% dos meus vídeos saíam sem som. A IA não estava quebrada; meus prompts é que eram vagos demais.
O Veo 3 segue uma lógica específica: ele não adiciona áudio por iniciativa própria. Se você não pedir, ele entende que deseja um vídeo mudo.
Por exemplo, ao escrever "A woman walking in the rain.", o Veo 3 cria fielmente a imagem de uma mulher caminhando sob a chuva, mas sem barulho de chuva, sem passos e sem som algum.
O prompt precisa ser mais explícito: "A woman walking in the rain. Audio: rain pattering on pavement, footsteps splashing through puddles."
Assim, o modelo entende que você quer o som da chuva e dos passos.
Existe outra armadilha: ao usar o Veo 3 no Flow, ajuste o modo de qualidade para “Highest Quality”. O modo de pré-visualização padrão não gera áudio. Caí nesse problema na primeira vez: fiz mais de dez tentativas sem som até perceber que a configuração estava errada.
Estratégias de prompt para os três tipos de áudio
Agora vamos ao ponto principal: como escrever prompts de áudio.
Diálogo (Dialogue): use uma estrutura fixa para obter resultados melhores
A fórmula é simples: descrição do personagem + ação + fala entre aspas
❌ Exemplo incorreto:
"A woman says hello." (Vago demais; a IA não sabe o que ela deve dizer.)
✅ Exemplo correto:
"The woman smiles and says, 'Welcome to Veo 3.'"
Para controlar o tom, adicione um modificador de emoção:
- angrily (com raiva)
- nervously (nervosamente)
- softly (em voz baixa)
- excitedly (com entusiasmo)
Exemplo completo:
"The man leans forward and says angrily, 'Where is my coffee?'"
Efeitos sonoros (Sound Effects): ação + descrição do som
Nesse tipo de prompt, descreva os detalhes do som com precisão.
❌ Exemplo vago:
"a phone" (A IA não sabe o que o telefone está fazendo.)
✅ Exemplos específicos:
"the sound of a phone ringing"
"water splashing in the background"
"soft house sounds, the creak of a closet door, and a ticking clock"
Uma dica: vincule o efeito sonoro à ação mostrada, usando termos como “as” e “when”.
"As the door creaks open, a gust of wind rushes in."
Assim, a relação de causa e efeito entre o som e a imagem fica clara.
Som ambiente (Ambient Noise): cena + camadas de som ao fundo
O som ambiente precisa transmitir uma sensação de “camadas”; caso contrário, o resultado fica sem profundidade.
❌ Exemplo superficial:
"city sounds" (Genérico demais.)
✅ Exemplos com camadas:
"the sounds of city traffic and distant sirens" (trânsito próximo + sirenes distantes)
"waves crashing on the shore" (som principal)
"the quiet hum of an office" (ruído de fundo)
Como descrever áudio espacial
Esta é uma técnica avançada, mas bastante útil.
O ouvido humano percebe a direção dos sons: o que está perto soa nítido; o que está longe, difuso. O Veo 3 também entende essa diferença, desde que você a descreva.
Use estas expressões para indicar relações espaciais:
- in the distance (ao longe)
- cuts through (atravessa, indicando o som principal)
- somewhere above (em algum ponto acima)
- faintly (fracamente)
- echoing (ecoando)
Exemplo completo, com um resultado muito bom nos meus testes:
Rain falls steadily onto wet pavement, pattering softly across rooftops and metal bins.
A single, low thunderclap rolls across the sky, echoing faintly between tall buildings.
A car passes faintly in the distance. A dog barks once.
A soft, tense melody plays from an old radio somewhere above.
Há quatro camadas aqui:
- Som principal em primeiro plano: chuva caindo sobre o asfalto
- Apoio no plano intermediário: trovão ecoando ao longe
- Fundo distante: um carro passando e um cachorro latindo uma vez
- Atmosfera: o rádio em algum lugar no andar de cima
O Veo 3 interpreta com bastante precisão esse tipo de descrição em camadas.
Diálogos na prática: faça os personagens falarem
Boas práticas para diálogos com uma pessoa
Gerar diálogos é a parte mais difícil dos recursos de áudio do Veo 3. Não porque seja tecnicamente complexo, mas porque há muitas regras.
A primeira regra é absoluta: a fala deve ser curta, com uma única frase e menos de 8 segundos.
Já tentei fazer um personagem dizer um trecho longo. O resultado omitiu partes da fala ou apresentou movimentos labiais completamente fora de sincronia. O Veo 3 ainda não é estável o bastante para sincronizar diálogos longos. Separe a fala em vários trechos ou faça o personagem terminar tudo em uma única frase.
A segunda regra: escreva emoção + ação + fala, os três elementos juntos.
❌ Exemplo sem intensidade:
"He says, 'Did you hear that?'"
✅ Exemplo com tensão:
"He bursts into wild laughter, head thrown back. Mid-laugh, he stops, eyes widening in terror, then whispers softly: 'Did you hear that?'"
Percebe a diferença? O segundo exemplo descreve também a transformação emocional: gargalhada → interrupção repentina → medo → sussurro. O Veo 3 consegue reproduzir essa mudança de emoção, com um resultado muito realista.
A terceira regra: a consistência do personagem é importante.
Ao gerar vários trechos, repita exatamente a mesma descrição do personagem em todos os prompts. Por exemplo, "a woman in a red coat with short black hair" deve aparecer da mesma forma em cada prompt. Caso contrário, a IA pode gerar outra personagem, com uma voz diferente.
Técnicas para diálogos com vários personagens
Duas pessoas falando ao mesmo tempo é o pior cenário para a geração de áudio no Veo 3.
Já tentei escrever um roteiro direto assim:
Man: "What are you doing?"
Woman: "None of your business."
O resultado foi péssimo: ou apenas uma pessoa tinha voz, ou as falas das duas não correspondiam à imagem.
A abordagem correta é: não escreva um roteiro de diálogo; descreva o fluxo da cena.
✅ Exemplo eficaz:
"Inside a cluttered garage, two teenage friends argue over a broken time machine. One leans over the table, frustrated and loud. The other avoids eye contact, mumbling and fiddling with wires. Rain hits the roof, and the lights flicker."
A lógica dessa abordagem é permitir que a IA entenda que “duas pessoas estão discutindo”, em vez de ordenar que “A diga isto e B diga aquilo”. O Veo 3 decide quando e como cada pessoa fala.
Ainda assim, a taxa de sucesso dos diálogos com várias pessoas continua menor do que a dos diálogos individuais. Para uma conversa complexa, recomendo deixar apenas uma pessoa falar em cada trecho e juntar tudo na edição.
Como melhorar a sincronização labial
Movimentos labiais fora de sincronia são o problema mais comum na geração de diálogos.
Três recomendações:
1. Deixe apenas um personagem falar em cada trecho
Isso já apareceu acima, mas vale repetir. Quando várias pessoas falam na mesma cena, a sincronização se perde com facilidade.
2. Descreva claramente que os personagens falam em turnos
Se o diálogo com várias pessoas for indispensável, indique quem fala primeiro e quem responde.
"The woman speaks first, then pauses. The man nods and replies."
3. Adicione “No subtitles.”
Muita gente não conhece esse detalhe. Às vezes, o Veo 3 gera legendas automaticamente sobre a imagem e cobre a boca do personagem. A instrução "No subtitles." desativa esse comportamento.
Diferenças entre diálogos em chinês e inglês
Há uma realidade frustrante: os diálogos em chinês funcionam muito pior do que em inglês.
Testei mais de vinte prompts com falas em chinês, e a taxa de sucesso ficou abaixo de 30%. Os problemas mais comuns foram:
- Falas omitidas: escrevi três frases, mas apenas uma foi gerada
- Personagem incorreto: a frase era de A, mas a boca de B se movia
- Sotaque estranho: o mandarim parecia robótico
O inglês funciona muito melhor. No mesmo tipo de cena, a taxa de sucesso dos prompts em inglês pode ultrapassar 70%.
Uma alternativa é: usar inglês para a fala principal e chinês para descrever a cena.
Por exemplo:
"一个穿红色外套的女人走进咖啡馆,微笑着对服务员说:'One cappuccino, please.'" (cena em chinês, fala em inglês)
Assim, o prompt continua fácil de entender para quem escreve em chinês sem comprometer a qualidade do diálogo.
Efeitos sonoros e trilha: crie uma experiência imersiva
Design de efeitos sonoros em camadas
Mais efeitos nem sempre significam um áudio melhor. Empilhar sons demais deixa tudo confuso.
Minha experiência é esta: use três camadas e estabeleça uma prioridade clara.
Primeiro plano (Foreground) — efeito sonoro da ação principal
É o foco da atenção do público. A porta abrindo, o copo quebrando ou os passos precisam soar nítidos e fortes.
Plano intermediário (Midground) — som ambiente de apoio
Não compete com o efeito principal, mas aumenta a sensação de realidade. Pode ser o ruído da máquina de café em uma cafeteria ou as conversas baixas dos clientes.
Fundo (Background) — música de atmosfera
É a camada que sustenta o áudio e cria o clima, como jazz suave ou o trânsito distante.
Exemplo completo para uma cafeteria:
Audio: espresso machine hissing (foreground), soft jazz music (background),
customers chatting quietly (midground). The barista says: "One cappuccino coming right up!"
Indicar as camadas entre parênteses ajuda o Veo 3 a interpretá-las com mais precisão. Sem essas indicações, o modelo às vezes deixa a música de fundo alta demais e encobre o diálogo.
Como controlar a emoção da música de fundo
A música de fundo costuma ser ignorada, mas é uma parte muito importante da cena.
Especifique o gênero musical:
- jazz
- classical (clássica)
- electronic (eletrônica)
- ambient (ambiente)
- upbeat (animada)
Use modificadores de emoção:
- tense (tensa)
- upbeat (animada)
- melancholic (melancólica)
- mysterious (misteriosa)
Exemplos específicos:
"A soft, tense melody plays"(uma melodia suave, mas tensa)"Upbeat festival music with steady drums"(música de festival animada, com batidas constantes)
Outro detalhe pouco conhecido é que também dá para controlar o tempo da música:
- slow tempo (andamento lento) → adequado para cenas tristes ou de lembranças
- fast tempo (andamento rápido) → adequado para cenas de ação ou perseguição
Como evitar conflitos entre os sons
Essa foi a maior armadilha que encontrei.
No início, eu pensava que mais efeitos tornariam a cena mais realista. Então, em um trecho de 5 segundos, pedi chuva, trovão, passos, trânsito, diálogo e música de fundo: seis elementos de áudio.
O resultado? O vídeo parecia uma confusão sonora, e não dava para entender nada.
Depois disso, adotei esta regra: use no máximo 3 ou 4 camadas de áudio em cada trecho e deixe as prioridades claras.
Use modificadores de volume para definir a importância de cada som:
- loud (alto) → efeito principal em primeiro plano
- soft (suave) → música de fundo
- faint (fraco) → som ambiente distante
- dominating (dominante) → efeito principal
Exemplo:
"Loud thunder crashes (dominating). Rain patters softly on the roof (background). A car engine starts faintly in the distance."
Assim, o Veo 3 entende que o trovão é o protagonista, a chuva serve de base e o carro é apenas um detalhe.
Diagnóstico: soluções para cinco problemas comuns de áudio
Problema 1: o vídeo gerado está sem som
Este é o problema mais comum. Cerca de 85% dos “vídeos mudos” são causados por um destes três motivos.
Causa 1: o áudio não foi especificado claramente no prompt
Verifique se o prompt contém palavras-chave como "Audio:", "says" ou uma fala entre aspas. Sem isso, o Veo 3 gera um vídeo mudo por padrão.
Soluções:
- Descreva o áudio em uma frase separada:
"Audio includes..." - Coloque o diálogo entre aspas:
"The man says, 'Hello.'" - Se nada funcionar, acrescente:
"Please generate this with clear speech."
Causa 2: o modo de qualidade está incorreto
O Flow tem dois modos: Preview (pré-visualização) e Highest Quality (qualidade máxima). O modo de pré-visualização não gera áudio.
Solução:
Abra o Flow → clique no ícone de configurações → selecione “Highest Quality”
Causa 3: a descrição do áudio ficou escondida no prompt
Se o prompt usa 300 palavras para descrever a imagem e deixa apenas "with dialogue" para o fim, o Veo 3 provavelmente ignorará a instrução de áudio.
Solução:
Antecipe as instruções de áudio e coloque-as na primeira metade do prompt.
Problema 2: a fala e os movimentos labiais estão fora de sincronia
Os lábios se movem de modo instável, e a voz fica uma fração de segundo adiantada. Isso é especialmente comum em diálogos com várias pessoas.
Causa principal: a IA se confunde ao processar vários falantes ao mesmo tempo.
Soluções:
- Separe os trechos: deixe apenas uma pessoa falar em cada trecho de 8 segundos e junte tudo depois
- Encurte a fala: limite cada frase a 5 segundos
- Indique os turnos:
"The woman speaks first, pauses, then the man responds."
Nos meus testes, a sincronização labial chegou a 80% com uma pessoa e ficou em apenas 40% com várias. Se a sincronização for essencial, não force um cenário complexo.
Problema 3: o áudio tem baixa qualidade ou não soa natural
A voz parece “flutuar”, soar mecânica ou lembrar um robô.
Causa: o prompt é vago demais e não descreve as características da voz.
Por exemplo, ao escrever "A man speaks", a IA não sabe como é a voz do homem. Grave? Aguda? Rouca? Sem essas informações, ela só consegue gerar uma “voz masculina média”.
Soluções:
-
Descreva as características da voz
- clara (clear)
- rouca (raspy)
- aguda (sharp)
- grave (deep)
-
Descreva a reverberação do ambiente
- em local fechado (indoor reverb)
- ao ar livre (outdoor, open space)
- espaço com eco (echoing space)
-
Especifique o sotaque e a velocidade para diálogos em inglês
- sotaque britânico (British accent)
- ritmo lento e deliberado (slow, deliberate pace)
Exemplo completo:
"A man with a deep, raspy voice speaks slowly in an indoor space: 'Welcome home.'"
Problema 4: os efeitos sonoros não correspondem às imagens
O personagem caminha sobre madeira, mas o som parece de passos em pedra. Ou o som da porta acontece um segundo antes da imagem.
Causa: a descrição do efeito sonoro está desconectada da cena visual.
Solução:
Descreva imagem e áudio na mesma frase, ligados por um termo de causa ou simultaneidade.
❌ Descrições separadas:
"A door opens. There is a creaking sound."
✅ Descrições vinculadas:
"As the door creaks open, a gust of wind rushes in."
Use estas palavras para estabelecer a relação:
- as (quando, ao mesmo tempo que)
- when (quando)
- while (enquanto)
- making (produzindo o som de)
Exemplo:
"She walks across the wooden floor, her heels clicking sharply with each step."
Problema 5: a música de fundo encobre o diálogo ou os efeitos
Esse problema é particularmente frustrante. Você prepara o diálogo com cuidado, mas a música de fundo o cobre por completo.
Causa: as camadas e a relação de volume não foram definidas.
Solução:
Use modificadores de volume para indicar com clareza qual som deve se destacar.
❌ Sem camadas:
"Background music plays. The woman says, 'Hello.'"
✅ Com camadas claras:
"Soft background music plays quietly. The woman's voice cuts through clearly: 'Hello.'"
Modificadores importantes:
- soft background music (música de fundo suave)
- loud foreground dialogue (diálogo alto em primeiro plano)
- voice cuts through (a voz atravessa os outros sons)
- music fades into background (a música recua para o fundo)
Outra dica: se o diálogo for importante, não use música de fundo. É uma solução simples e direta, mas funciona.
Técnicas avançadas para aumentar a taxa de sucesso do áudio
Use um gerador de prompts para o Veo 3
Ao escrever prompts à mão, é fácil esquecer detalhes. Uma forma prática de evitar isso é usar um gerador de prompts.
Duas ferramentas gratuitas recomendadas:
-
prompt-helper.com/veo-3-prompt-generator
Não exige login. Você descreve a cena, e a ferramenta gera automaticamente um prompt completo com instruções de áudio. -
Gerador oficial de prompts para o Veo 3.1 do Google
Ele está integrado ao editor Flow e sugere elementos de áudio com base na cena.
Hoje, geralmente começo cenas complexas com um gerador e depois ajusto os detalhes manualmente. Isso economiza bastante tempo.
Estratégias para controlar custos
O Veo 3 cobra US$ 0,75 por segundo.
Um vídeo de 8 segundos custa US$ 6; um minuto, US$ 45. Se você precisar de cinco ou seis tentativas, o gasto cresce rápido.
Formas de economizar:
1. Teste primeiro em um modo de baixa qualidade
O Flow oferece o modo “Draft”, que gera o vídeo com rapidez e custa menos, mas não produz áudio.
Use-o para testar o enquadramento. Quando estiver tudo certo, renderize a versão com áudio em Highest Quality.
2. Reduza a duração do vídeo
Não comece gerando 60 segundos. Faça primeiro um trecho de teste de 5 a 8 segundos e aumente a duração somente depois de aprovar o áudio.
3. Use o recurso “Extend”
O recurso Extend do Veo 3.1 prolonga um vídeo existente e custa menos do que gerar tudo novamente. Agora, o Extend também consegue dar continuidade ao áudio.
Ajustes posteriores no editor Flow
O Veo 3.1 tem uma integração profunda com o Flow, e alguns problemas de áudio podem ser corrigidos depois da geração.
Ajustes disponíveis:
- Equilíbrio de volume: se a música de fundo estiver alta demais, use as ferramentas de áudio do Flow para diminuir o volume
- Junção de trechos: combine vários trechos com uma única pessoa falando para formar um diálogo completo; é mais confiável do que gerar várias pessoas conversando de uma só vez
- Substituição de áudio: mantenha as imagens e troque apenas a faixa de áudio; isso foge um pouco da proposta de “áudio nativo”, mas pode salvar o material
O recurso “Extend” do Flow é especialmente útil:
Gere um vídeo de 8 segundos com áudio e use o Extend para levá-lo a 15 segundos. O áudio continua de forma natural, com uma taxa de sucesso maior do que a geração de um novo vídeo de 15 segundos.
Para ser franco, os recursos de edição de áudio do Flow ainda são básicos. Um acabamento profissional continua exigindo a exportação para o Premiere ou o Final Cut.
Conclusão
Depois de tudo isso, o essencial cabe em três frases:
Especifique o áudio — o Veo 3 não preenche essa parte sozinho; diga exatamente quais sons você quer.
Trabalhe em camadas — estabeleça prioridades entre diálogo, efeitos sonoros e música de fundo, sem empilhar elementos.
Use falas curtas — mantenha os diálogos em até 8 segundos e deixe apenas uma pessoa falar por vez.
É preciso fazer algumas tentativas para entender a geração de áudio do Veo 3. Descartei cerca de 20 vídeos de teste até compreender essas regras. Depois disso, porém, a criação de vídeos ficou várias vezes mais eficiente: um trabalho de dublagem que levaria 4 horas no processo tradicional agora pode ser concluído em 3 minutos.
Embora o Veo 3.1 ainda não tenha um bom suporte para chinês e precise melhorar a sincronização de diálogos com várias pessoas, ele já representa um avanço importante na geração de vídeo. Segundo o Google, o Veo 3 continua evoluindo rapidamente, e é provável que esses problemas melhorem no próximo ano.
Agora é hora de testar:
- Abra o Veo 3 e selecione o modo Highest Quality
- Copie um dos modelos de prompt deste artigo e adapte-o à sua cena
- Gere seu primeiro vídeo com IA e áudio
Se surgir algum problema, consulte novamente a lista de diagnóstico da quinta seção. Gerar áudio exige técnica, mas não é magia. Depois de algumas tentativas, a lógica fica clara.
FAQ
Por que o vídeo gerado pelo Veo 3 está sem som?
1) O áudio não foi especificado no prompt:
• Inclua palavras-chave como Audio:, says ou uma fala entre aspas
2) O modo de qualidade está incorreto:
• Selecione Highest Quality
• O modo de pré-visualização não gera áudio
3) A descrição do áudio ficou escondida no prompt:
• Coloque as instruções de áudio na primeira metade do texto
Como fazer um personagem falar?
Exemplo: 'The woman smiles and says, "Welcome to Veo 3."'
Cuidados:
• Mantenha a fala curta, com no máximo 8 segundos
• Adicione modificadores de tom, como angrily, softly ou excitedly, para controlar a emoção
O que fazer quando a fala e os movimentos labiais estão fora de sincronia?
1) Separe a cena em trechos e deixe apenas uma pessoa falar em cada trecho de 8 segundos
2) Encurte a fala para que cada frase dure no máximo 5 segundos
3) Descreva claramente que os personagens falam em turnos
Comparação das taxas de sucesso:
• A sincronização labial chega a 80% em diálogos com uma pessoa
• Em diálogos com várias pessoas, cai para apenas 40%
Como adicionar efeitos sonoros e música de fundo?
• SFX para efeitos sonoros
• Ambient para sons ambientes
Organize o áudio em três camadas:
• Primeiro plano: efeito da ação principal
• Plano intermediário: som ambiente de apoio
• Fundo: música de atmosfera
Dicas:
• Indique as camadas entre parênteses
• Use modificadores de volume, como loud, soft e faint, para definir as prioridades
• Limite cada trecho a 3 ou 4 camadas de áudio
Por que os diálogos em chinês funcionam pior do que em inglês?
• Falas omitidas
• Confusão sobre qual personagem está falando
• Sotaque estranho
Com prompts em inglês, a taxa de sucesso pode ultrapassar 70%.
Alternativa: use inglês para a fala principal e chinês para descrever a cena
Exemplo: '一个穿红色外套的女人走进咖啡馆,微笑着对服务员说:"One cappuccino, please."'
Como controlar o custo da geração de áudio?
1) Teste primeiro o enquadramento no modo Draft e, depois de aprová-lo, renderize a versão com áudio em Highest Quality
2) Reduza a duração e comece com um trecho de teste de 5 a 8 segundos
3) Use o recurso Extend para prolongar um vídeo existente; ele custa menos do que gerar tudo novamente
O Veo 3 custa US$ 0,75 por segundo, ou US$ 6 por um vídeo de 8 segundos.
19 min de leitura · Publicado em: 7 dez 2025 · Atualizado em: 4 set 2026
Guia Veo3
Se você chegou pela busca, o caminho mais rápido é ir para o post anterior ou próximo desta série.
Anterior
Controle de câmera no Veo 3: 7 movimentos para dar um visual cinematográfico aos vídeos de IA
Aprenda a escrever prompts com dolly shot, tracking shot e outros sete movimentos de câmera para deixar os vídeos gerados pelo Veo 3 mais cinematográficos. Inclui modelos prontos e dicas para evitar erros comuns.
Parte 2 de 7
Próximo
Guia completo de consistência de personagens no Veo 3: crie vídeos coerentes com várias cenas usando o Scenebuilder
Aprenda a usar o Scenebuilder do Veo 3 para evitar mudanças na aparência dos personagens em vídeos com várias cenas, com passo a passo completo, modelos de prompt e dicas práticas.
Parte 4 de 7



Comentários
Entre com GitHub para comentar