Alternar tema

Áudio no Veo 3: como gerar diálogos, efeitos e trilhas com IA

Easton editorial illustration: local model vault

O Veo 3 não adiciona som automaticamente aos vídeos. Mesmo que o prompt contenha "A woman says: 'Hello'", o resultado será um vídeo mudo se o modo de qualidade estiver incorreto ou se a descrição do áudio não for clara o bastante.

Quando o Google apresentou o Veo 3 no I/O de 2025, um dos principais destaques foi o suporte nativo a áudio: diálogos, efeitos sonoros e música de fundo podem ser gerados em sincronia com as imagens. Esse recurso, porém, não vem ativado por padrão. O prompt precisa indicar quem fala, o que a pessoa diz, quais sons existem na cena e, em diálogos com várias pessoas, quem fala primeiro. A sincronização labial chega a cerca de 80% em diálogos com uma pessoa, cai para menos de 40% com várias pessoas e fica em apenas 30% para falas em chinês.

Este artigo explica toda a lógica da geração de áudio no Veo 3, traz modelos de prompt para diálogos, efeitos e trilhas, além de métodos para diagnosticar cinco problemas recorrentes.

A revolução do áudio no Veo 3: o fim dos vídeos mudos

O que é geração nativa de áudio

O processo tradicional de geração de vídeo com IA funciona assim: primeiro você cria as imagens; depois, precisa encontrar dubladores, gravar, produzir efeitos e mixar tudo. A equipe da Promise Studios calculou que o processo completo leva, em média, 4 horas.

O Veo 3 reduz esse trabalho a 3 minutos.

Ele usa uma “arquitetura dual-stream”. O nome parece técnico, mas significa apenas que vídeo e áudio são gerados ao mesmo tempo e alinhados automaticamente. Você fornece um prompt, e a IA cria as imagens enquanto produz os sons. Quando um personagem fala, os movimentos da boca e a voz já nascem sincronizados. Os sons ambientes também acompanham a cena: se chove, ouvimos a chuva; se alguém caminha sobre um piso de madeira, ouvimos os passos.

Há, porém, um detalhe essencial: os recursos de áudio do Veo 3 se dividem em três categorias. É preciso diferenciá-las para obter bons resultados:

1. Diálogo (Dialogue)
É o que um personagem ou narrador diz. Você pode controlar o tom, o sotaque e a emoção.

2. Efeitos sonoros (Sound Effects)
São sons específicos que acontecem na cena: o telefone tocando, a água espirrando ou uma porta abrindo com um rangido.

3. Som ambiente (Ambient Noise)
É o áudio de fundo que torna a cena verossímil: o trânsito da cidade, as ondas quebrando na praia ou o zumbido do ar-condicionado no escritório.

A atualização de áudio do Veo 3.1 em outubro de 2025

Em 14 de outubro de 2025, o Google lançou o Veo 3.1, com uma melhora perceptível na qualidade do áudio.

Nos meus próprios testes comparativos, os diálogos gerados pelo Veo 3 às vezes pareciam “flutuar”: a voz ficava uma fração de segundo fora de sincronia com a boca. O Veo 3.1 praticamente resolveu esse problema e agora também oferece suporte a diálogos com várias pessoas: dois personagens podem falar em turnos sem que as vozes se confundam.

Outra atualização bastante útil é que, antes, somente o recurso de “texto para vídeo” aceitava áudio. Agora, recursos como “Ingredients to Video” (gerar um vídeo a partir de imagens enviadas) e “Frame Extension” (aumentar a duração do vídeo) também oferecem suporte a áudio.

Ainda assim, é importante deixar claro que o áudio gerado pelo Veo 3.1 se parece mais com um “first draft”, ou seja, uma primeira versão. Segundo relatos da comunidade, a naturalidade pode chegar a 92% de uma gravação humana. Em um projeto profissional, porém, ainda vale fazer um acabamento posterior. Afinal, cada segundo de vídeo custa US$ 0,75; usar o primeiro resultado como produto final é arriscado.

Princípio básico dos prompts de áudio: seja explícito

Por que o vídeo sai sem som

Quando comecei a usar o Veo 3, cerca de 70% dos meus vídeos saíam sem som. A IA não estava quebrada; meus prompts é que eram vagos demais.

O Veo 3 segue uma lógica específica: ele não adiciona áudio por iniciativa própria. Se você não pedir, ele entende que deseja um vídeo mudo.

Por exemplo, ao escrever "A woman walking in the rain.", o Veo 3 cria fielmente a imagem de uma mulher caminhando sob a chuva, mas sem barulho de chuva, sem passos e sem som algum.

O prompt precisa ser mais explícito: "A woman walking in the rain. Audio: rain pattering on pavement, footsteps splashing through puddles."
Assim, o modelo entende que você quer o som da chuva e dos passos.

Existe outra armadilha: ao usar o Veo 3 no Flow, ajuste o modo de qualidade para “Highest Quality”. O modo de pré-visualização padrão não gera áudio. Caí nesse problema na primeira vez: fiz mais de dez tentativas sem som até perceber que a configuração estava errada.

Estratégias de prompt para os três tipos de áudio

Agora vamos ao ponto principal: como escrever prompts de áudio.

Diálogo (Dialogue): use uma estrutura fixa para obter resultados melhores

A fórmula é simples: descrição do personagem + ação + fala entre aspas

❌ Exemplo incorreto:
"A woman says hello." (Vago demais; a IA não sabe o que ela deve dizer.)

✅ Exemplo correto:
"The woman smiles and says, 'Welcome to Veo 3.'"

Para controlar o tom, adicione um modificador de emoção:

  • angrily (com raiva)
  • nervously (nervosamente)
  • softly (em voz baixa)
  • excitedly (com entusiasmo)

Exemplo completo:
"The man leans forward and says angrily, 'Where is my coffee?'"

Efeitos sonoros (Sound Effects): ação + descrição do som

Nesse tipo de prompt, descreva os detalhes do som com precisão.

❌ Exemplo vago:
"a phone" (A IA não sabe o que o telefone está fazendo.)

✅ Exemplos específicos:
"the sound of a phone ringing"
"water splashing in the background"
"soft house sounds, the creak of a closet door, and a ticking clock"

Uma dica: vincule o efeito sonoro à ação mostrada, usando termos como “as” e “when”.
"As the door creaks open, a gust of wind rushes in."
Assim, a relação de causa e efeito entre o som e a imagem fica clara.

Som ambiente (Ambient Noise): cena + camadas de som ao fundo

O som ambiente precisa transmitir uma sensação de “camadas”; caso contrário, o resultado fica sem profundidade.

❌ Exemplo superficial:
"city sounds" (Genérico demais.)

✅ Exemplos com camadas:
"the sounds of city traffic and distant sirens" (trânsito próximo + sirenes distantes)
"waves crashing on the shore" (som principal)
"the quiet hum of an office" (ruído de fundo)

Como descrever áudio espacial

Esta é uma técnica avançada, mas bastante útil.

O ouvido humano percebe a direção dos sons: o que está perto soa nítido; o que está longe, difuso. O Veo 3 também entende essa diferença, desde que você a descreva.

Use estas expressões para indicar relações espaciais:

  • in the distance (ao longe)
  • cuts through (atravessa, indicando o som principal)
  • somewhere above (em algum ponto acima)
  • faintly (fracamente)
  • echoing (ecoando)

Exemplo completo, com um resultado muito bom nos meus testes:

Rain falls steadily onto wet pavement, pattering softly across rooftops and metal bins.
A single, low thunderclap rolls across the sky, echoing faintly between tall buildings.
A car passes faintly in the distance. A dog barks once.
A soft, tense melody plays from an old radio somewhere above.

Há quatro camadas aqui:

  • Som principal em primeiro plano: chuva caindo sobre o asfalto
  • Apoio no plano intermediário: trovão ecoando ao longe
  • Fundo distante: um carro passando e um cachorro latindo uma vez
  • Atmosfera: o rádio em algum lugar no andar de cima

O Veo 3 interpreta com bastante precisão esse tipo de descrição em camadas.

Diálogos na prática: faça os personagens falarem

Boas práticas para diálogos com uma pessoa

Gerar diálogos é a parte mais difícil dos recursos de áudio do Veo 3. Não porque seja tecnicamente complexo, mas porque há muitas regras.

A primeira regra é absoluta: a fala deve ser curta, com uma única frase e menos de 8 segundos.

Já tentei fazer um personagem dizer um trecho longo. O resultado omitiu partes da fala ou apresentou movimentos labiais completamente fora de sincronia. O Veo 3 ainda não é estável o bastante para sincronizar diálogos longos. Separe a fala em vários trechos ou faça o personagem terminar tudo em uma única frase.

A segunda regra: escreva emoção + ação + fala, os três elementos juntos.

❌ Exemplo sem intensidade:
"He says, 'Did you hear that?'"

✅ Exemplo com tensão:
"He bursts into wild laughter, head thrown back. Mid-laugh, he stops, eyes widening in terror, then whispers softly: 'Did you hear that?'"

Percebe a diferença? O segundo exemplo descreve também a transformação emocional: gargalhada → interrupção repentina → medo → sussurro. O Veo 3 consegue reproduzir essa mudança de emoção, com um resultado muito realista.

A terceira regra: a consistência do personagem é importante.

Ao gerar vários trechos, repita exatamente a mesma descrição do personagem em todos os prompts. Por exemplo, "a woman in a red coat with short black hair" deve aparecer da mesma forma em cada prompt. Caso contrário, a IA pode gerar outra personagem, com uma voz diferente.

Técnicas para diálogos com vários personagens

Duas pessoas falando ao mesmo tempo é o pior cenário para a geração de áudio no Veo 3.

Já tentei escrever um roteiro direto assim:

Man: "What are you doing?"
Woman: "None of your business."

O resultado foi péssimo: ou apenas uma pessoa tinha voz, ou as falas das duas não correspondiam à imagem.

A abordagem correta é: não escreva um roteiro de diálogo; descreva o fluxo da cena.

✅ Exemplo eficaz:
"Inside a cluttered garage, two teenage friends argue over a broken time machine. One leans over the table, frustrated and loud. The other avoids eye contact, mumbling and fiddling with wires. Rain hits the roof, and the lights flicker."

A lógica dessa abordagem é permitir que a IA entenda que “duas pessoas estão discutindo”, em vez de ordenar que “A diga isto e B diga aquilo”. O Veo 3 decide quando e como cada pessoa fala.

Ainda assim, a taxa de sucesso dos diálogos com várias pessoas continua menor do que a dos diálogos individuais. Para uma conversa complexa, recomendo deixar apenas uma pessoa falar em cada trecho e juntar tudo na edição.

Como melhorar a sincronização labial

Movimentos labiais fora de sincronia são o problema mais comum na geração de diálogos.

Três recomendações:

1. Deixe apenas um personagem falar em cada trecho
Isso já apareceu acima, mas vale repetir. Quando várias pessoas falam na mesma cena, a sincronização se perde com facilidade.

2. Descreva claramente que os personagens falam em turnos
Se o diálogo com várias pessoas for indispensável, indique quem fala primeiro e quem responde.
"The woman speaks first, then pauses. The man nods and replies."

3. Adicione “No subtitles.”
Muita gente não conhece esse detalhe. Às vezes, o Veo 3 gera legendas automaticamente sobre a imagem e cobre a boca do personagem. A instrução "No subtitles." desativa esse comportamento.

Diferenças entre diálogos em chinês e inglês

Há uma realidade frustrante: os diálogos em chinês funcionam muito pior do que em inglês.

Testei mais de vinte prompts com falas em chinês, e a taxa de sucesso ficou abaixo de 30%. Os problemas mais comuns foram:

  • Falas omitidas: escrevi três frases, mas apenas uma foi gerada
  • Personagem incorreto: a frase era de A, mas a boca de B se movia
  • Sotaque estranho: o mandarim parecia robótico

O inglês funciona muito melhor. No mesmo tipo de cena, a taxa de sucesso dos prompts em inglês pode ultrapassar 70%.

Uma alternativa é: usar inglês para a fala principal e chinês para descrever a cena.

Por exemplo:
"一个穿红色外套的女人走进咖啡馆,微笑着对服务员说:'One cappuccino, please.'" (cena em chinês, fala em inglês)

Assim, o prompt continua fácil de entender para quem escreve em chinês sem comprometer a qualidade do diálogo.

Efeitos sonoros e trilha: crie uma experiência imersiva

Design de efeitos sonoros em camadas

Mais efeitos nem sempre significam um áudio melhor. Empilhar sons demais deixa tudo confuso.

Minha experiência é esta: use três camadas e estabeleça uma prioridade clara.

Primeiro plano (Foreground) — efeito sonoro da ação principal
É o foco da atenção do público. A porta abrindo, o copo quebrando ou os passos precisam soar nítidos e fortes.

Plano intermediário (Midground) — som ambiente de apoio
Não compete com o efeito principal, mas aumenta a sensação de realidade. Pode ser o ruído da máquina de café em uma cafeteria ou as conversas baixas dos clientes.

Fundo (Background) — música de atmosfera
É a camada que sustenta o áudio e cria o clima, como jazz suave ou o trânsito distante.

Exemplo completo para uma cafeteria:

Audio: espresso machine hissing (foreground), soft jazz music (background),
customers chatting quietly (midground). The barista says: "One cappuccino coming right up!"

Indicar as camadas entre parênteses ajuda o Veo 3 a interpretá-las com mais precisão. Sem essas indicações, o modelo às vezes deixa a música de fundo alta demais e encobre o diálogo.

Como controlar a emoção da música de fundo

A música de fundo costuma ser ignorada, mas é uma parte muito importante da cena.

Especifique o gênero musical:

  • jazz
  • classical (clássica)
  • electronic (eletrônica)
  • ambient (ambiente)
  • upbeat (animada)

Use modificadores de emoção:

  • tense (tensa)
  • upbeat (animada)
  • melancholic (melancólica)
  • mysterious (misteriosa)

Exemplos específicos:

  • "A soft, tense melody plays" (uma melodia suave, mas tensa)
  • "Upbeat festival music with steady drums" (música de festival animada, com batidas constantes)

Outro detalhe pouco conhecido é que também dá para controlar o tempo da música:

  • slow tempo (andamento lento) → adequado para cenas tristes ou de lembranças
  • fast tempo (andamento rápido) → adequado para cenas de ação ou perseguição

Como evitar conflitos entre os sons

Essa foi a maior armadilha que encontrei.

No início, eu pensava que mais efeitos tornariam a cena mais realista. Então, em um trecho de 5 segundos, pedi chuva, trovão, passos, trânsito, diálogo e música de fundo: seis elementos de áudio.

O resultado? O vídeo parecia uma confusão sonora, e não dava para entender nada.

Depois disso, adotei esta regra: use no máximo 3 ou 4 camadas de áudio em cada trecho e deixe as prioridades claras.

Use modificadores de volume para definir a importância de cada som:

  • loud (alto) → efeito principal em primeiro plano
  • soft (suave) → música de fundo
  • faint (fraco) → som ambiente distante
  • dominating (dominante) → efeito principal

Exemplo:
"Loud thunder crashes (dominating). Rain patters softly on the roof (background). A car engine starts faintly in the distance."

Assim, o Veo 3 entende que o trovão é o protagonista, a chuva serve de base e o carro é apenas um detalhe.

Diagnóstico: soluções para cinco problemas comuns de áudio

Problema 1: o vídeo gerado está sem som

Este é o problema mais comum. Cerca de 85% dos “vídeos mudos” são causados por um destes três motivos.

Causa 1: o áudio não foi especificado claramente no prompt

Verifique se o prompt contém palavras-chave como "Audio:", "says" ou uma fala entre aspas. Sem isso, o Veo 3 gera um vídeo mudo por padrão.

Soluções:

  • Descreva o áudio em uma frase separada: "Audio includes..."
  • Coloque o diálogo entre aspas: "The man says, 'Hello.'"
  • Se nada funcionar, acrescente: "Please generate this with clear speech."

Causa 2: o modo de qualidade está incorreto

O Flow tem dois modos: Preview (pré-visualização) e Highest Quality (qualidade máxima). O modo de pré-visualização não gera áudio.

Solução:
Abra o Flow → clique no ícone de configurações → selecione “Highest Quality”

Causa 3: a descrição do áudio ficou escondida no prompt

Se o prompt usa 300 palavras para descrever a imagem e deixa apenas "with dialogue" para o fim, o Veo 3 provavelmente ignorará a instrução de áudio.

Solução:
Antecipe as instruções de áudio e coloque-as na primeira metade do prompt.

Problema 2: a fala e os movimentos labiais estão fora de sincronia

Os lábios se movem de modo instável, e a voz fica uma fração de segundo adiantada. Isso é especialmente comum em diálogos com várias pessoas.

Causa principal: a IA se confunde ao processar vários falantes ao mesmo tempo.

Soluções:

  1. Separe os trechos: deixe apenas uma pessoa falar em cada trecho de 8 segundos e junte tudo depois
  2. Encurte a fala: limite cada frase a 5 segundos
  3. Indique os turnos: "The woman speaks first, pauses, then the man responds."

Nos meus testes, a sincronização labial chegou a 80% com uma pessoa e ficou em apenas 40% com várias. Se a sincronização for essencial, não force um cenário complexo.

Problema 3: o áudio tem baixa qualidade ou não soa natural

A voz parece “flutuar”, soar mecânica ou lembrar um robô.

Causa: o prompt é vago demais e não descreve as características da voz.

Por exemplo, ao escrever "A man speaks", a IA não sabe como é a voz do homem. Grave? Aguda? Rouca? Sem essas informações, ela só consegue gerar uma “voz masculina média”.

Soluções:

  1. Descreva as características da voz

    • clara (clear)
    • rouca (raspy)
    • aguda (sharp)
    • grave (deep)
  2. Descreva a reverberação do ambiente

    • em local fechado (indoor reverb)
    • ao ar livre (outdoor, open space)
    • espaço com eco (echoing space)
  3. Especifique o sotaque e a velocidade para diálogos em inglês

    • sotaque britânico (British accent)
    • ritmo lento e deliberado (slow, deliberate pace)

Exemplo completo:
"A man with a deep, raspy voice speaks slowly in an indoor space: 'Welcome home.'"

Problema 4: os efeitos sonoros não correspondem às imagens

O personagem caminha sobre madeira, mas o som parece de passos em pedra. Ou o som da porta acontece um segundo antes da imagem.

Causa: a descrição do efeito sonoro está desconectada da cena visual.

Solução:
Descreva imagem e áudio na mesma frase, ligados por um termo de causa ou simultaneidade.

❌ Descrições separadas:
"A door opens. There is a creaking sound."

✅ Descrições vinculadas:
"As the door creaks open, a gust of wind rushes in."

Use estas palavras para estabelecer a relação:

  • as (quando, ao mesmo tempo que)
  • when (quando)
  • while (enquanto)
  • making (produzindo o som de)

Exemplo:
"She walks across the wooden floor, her heels clicking sharply with each step."

Problema 5: a música de fundo encobre o diálogo ou os efeitos

Esse problema é particularmente frustrante. Você prepara o diálogo com cuidado, mas a música de fundo o cobre por completo.

Causa: as camadas e a relação de volume não foram definidas.

Solução:
Use modificadores de volume para indicar com clareza qual som deve se destacar.

❌ Sem camadas:
"Background music plays. The woman says, 'Hello.'"

✅ Com camadas claras:
"Soft background music plays quietly. The woman's voice cuts through clearly: 'Hello.'"

Modificadores importantes:

  • soft background music (música de fundo suave)
  • loud foreground dialogue (diálogo alto em primeiro plano)
  • voice cuts through (a voz atravessa os outros sons)
  • music fades into background (a música recua para o fundo)

Outra dica: se o diálogo for importante, não use música de fundo. É uma solução simples e direta, mas funciona.

Técnicas avançadas para aumentar a taxa de sucesso do áudio

Use um gerador de prompts para o Veo 3

Ao escrever prompts à mão, é fácil esquecer detalhes. Uma forma prática de evitar isso é usar um gerador de prompts.

Duas ferramentas gratuitas recomendadas:

  1. prompt-helper.com/veo-3-prompt-generator
    Não exige login. Você descreve a cena, e a ferramenta gera automaticamente um prompt completo com instruções de áudio.

  2. Gerador oficial de prompts para o Veo 3.1 do Google
    Ele está integrado ao editor Flow e sugere elementos de áudio com base na cena.

Hoje, geralmente começo cenas complexas com um gerador e depois ajusto os detalhes manualmente. Isso economiza bastante tempo.

Estratégias para controlar custos

O Veo 3 cobra US$ 0,75 por segundo.

Um vídeo de 8 segundos custa US$ 6; um minuto, US$ 45. Se você precisar de cinco ou seis tentativas, o gasto cresce rápido.

Formas de economizar:

1. Teste primeiro em um modo de baixa qualidade
O Flow oferece o modo “Draft”, que gera o vídeo com rapidez e custa menos, mas não produz áudio.
Use-o para testar o enquadramento. Quando estiver tudo certo, renderize a versão com áudio em Highest Quality.

2. Reduza a duração do vídeo
Não comece gerando 60 segundos. Faça primeiro um trecho de teste de 5 a 8 segundos e aumente a duração somente depois de aprovar o áudio.

3. Use o recurso “Extend”
O recurso Extend do Veo 3.1 prolonga um vídeo existente e custa menos do que gerar tudo novamente. Agora, o Extend também consegue dar continuidade ao áudio.

Ajustes posteriores no editor Flow

O Veo 3.1 tem uma integração profunda com o Flow, e alguns problemas de áudio podem ser corrigidos depois da geração.

Ajustes disponíveis:

  • Equilíbrio de volume: se a música de fundo estiver alta demais, use as ferramentas de áudio do Flow para diminuir o volume
  • Junção de trechos: combine vários trechos com uma única pessoa falando para formar um diálogo completo; é mais confiável do que gerar várias pessoas conversando de uma só vez
  • Substituição de áudio: mantenha as imagens e troque apenas a faixa de áudio; isso foge um pouco da proposta de “áudio nativo”, mas pode salvar o material

O recurso “Extend” do Flow é especialmente útil:
Gere um vídeo de 8 segundos com áudio e use o Extend para levá-lo a 15 segundos. O áudio continua de forma natural, com uma taxa de sucesso maior do que a geração de um novo vídeo de 15 segundos.

Para ser franco, os recursos de edição de áudio do Flow ainda são básicos. Um acabamento profissional continua exigindo a exportação para o Premiere ou o Final Cut.

Conclusão

Depois de tudo isso, o essencial cabe em três frases:

Especifique o áudio — o Veo 3 não preenche essa parte sozinho; diga exatamente quais sons você quer.

Trabalhe em camadas — estabeleça prioridades entre diálogo, efeitos sonoros e música de fundo, sem empilhar elementos.

Use falas curtas — mantenha os diálogos em até 8 segundos e deixe apenas uma pessoa falar por vez.

É preciso fazer algumas tentativas para entender a geração de áudio do Veo 3. Descartei cerca de 20 vídeos de teste até compreender essas regras. Depois disso, porém, a criação de vídeos ficou várias vezes mais eficiente: um trabalho de dublagem que levaria 4 horas no processo tradicional agora pode ser concluído em 3 minutos.

Embora o Veo 3.1 ainda não tenha um bom suporte para chinês e precise melhorar a sincronização de diálogos com várias pessoas, ele já representa um avanço importante na geração de vídeo. Segundo o Google, o Veo 3 continua evoluindo rapidamente, e é provável que esses problemas melhorem no próximo ano.

Agora é hora de testar:

  1. Abra o Veo 3 e selecione o modo Highest Quality
  2. Copie um dos modelos de prompt deste artigo e adapte-o à sua cena
  3. Gere seu primeiro vídeo com IA e áudio

Se surgir algum problema, consulte novamente a lista de diagnóstico da quinta seção. Gerar áudio exige técnica, mas não é magia. Depois de algumas tentativas, a lógica fica clara.

FAQ

Por que o vídeo gerado pelo Veo 3 está sem som?
Há três causas comuns:

1) O áudio não foi especificado no prompt:
• Inclua palavras-chave como Audio:, says ou uma fala entre aspas

2) O modo de qualidade está incorreto:
• Selecione Highest Quality
• O modo de pré-visualização não gera áudio

3) A descrição do áudio ficou escondida no prompt:
• Coloque as instruções de áudio na primeira metade do texto
Como fazer um personagem falar?
Use este formato: descrição do personagem + ação + fala entre aspas

Exemplo: 'The woman smiles and says, "Welcome to Veo 3."'

Cuidados:
• Mantenha a fala curta, com no máximo 8 segundos
• Adicione modificadores de tom, como angrily, softly ou excitedly, para controlar a emoção
O que fazer quando a fala e os movimentos labiais estão fora de sincronia?
Há três soluções:

1) Separe a cena em trechos e deixe apenas uma pessoa falar em cada trecho de 8 segundos

2) Encurte a fala para que cada frase dure no máximo 5 segundos

3) Descreva claramente que os personagens falam em turnos

Comparação das taxas de sucesso:
• A sincronização labial chega a 80% em diálogos com uma pessoa
• Em diálogos com várias pessoas, cai para apenas 40%
Como adicionar efeitos sonoros e música de fundo?
Use estas marcações:
• SFX para efeitos sonoros
• Ambient para sons ambientes

Organize o áudio em três camadas:
• Primeiro plano: efeito da ação principal
• Plano intermediário: som ambiente de apoio
• Fundo: música de atmosfera

Dicas:
• Indique as camadas entre parênteses
• Use modificadores de volume, como loud, soft e faint, para definir as prioridades
• Limite cada trecho a 3 ou 4 camadas de áudio
Por que os diálogos em chinês funcionam pior do que em inglês?
A taxa de sucesso dos diálogos em chinês fica abaixo de 30%. Os problemas mais comuns são:
• Falas omitidas
• Confusão sobre qual personagem está falando
• Sotaque estranho

Com prompts em inglês, a taxa de sucesso pode ultrapassar 70%.

Alternativa: use inglês para a fala principal e chinês para descrever a cena

Exemplo: '一个穿红色外套的女人走进咖啡馆,微笑着对服务员说:"One cappuccino, please."'
Como controlar o custo da geração de áudio?
Três formas de economizar:

1) Teste primeiro o enquadramento no modo Draft e, depois de aprová-lo, renderize a versão com áudio em Highest Quality

2) Reduza a duração e comece com um trecho de teste de 5 a 8 segundos

3) Use o recurso Extend para prolongar um vídeo existente; ele custa menos do que gerar tudo novamente

O Veo 3 custa US$ 0,75 por segundo, ou US$ 6 por um vídeo de 8 segundos.

19 min de leitura · Publicado em: 7 dez 2025 · Atualizado em: 4 set 2026

Comentários

Entre com GitHub para comentar

Easton BlogEaston Blog