Alternar tema

Guia completo de consistência de personagens no Veo 3: crie vídeos coerentes com várias cenas usando o Scenebuilder

Easton editorial illustration: permission gate hub

Na primeira vez que usei o Veo 3 para gerar um vídeo com várias cenas, preparei com cuidado o roteiro de um curta com cinco tomadas e fui criando cada uma cheio de expectativa. O resultado? Na primeira cena, o protagonista tinha cabelo preto curto e vestia um terno azul; na segunda, de repente apareceu com cabelo castanho comprido e moletom cinza; na terceira, até o formato do rosto já tinha mudado. Era literalmente outra pessoa.

Se isso também aconteceu com você, saiba que não está sozinho. A inconsistência na aparência dos personagens é um dos problemas mais frustrantes da geração de vídeos com IA. Depois de muitos testes e pesquisas, porém, encontrei um método que realmente funciona. Neste artigo, vou compartilhar tudo o que aprendi.

Por que os personagens mudam tanto nos vídeos com IA?

Antes de falar das soluções, precisamos entender por que os personagens dos vídeos com IA vivem mudando. Só assim dá para atacar o problema certo.

A IA sofre de “amnésia”

Esse é o principal problema. Veo 3, Runway e praticamente todos os modelos de geração de vídeo com IA têm uma limitação decisiva: não possuem memória de longo prazo.

O que isso significa? Se você pede à IA que gere um homem de terno preto na primeira cena, ela não guarda a aparência desse personagem. Na hora de gerar a segunda cena, o modelo enxerga uma tarefa totalmente nova. É como conversar com alguém que perdeu a memória e precisar se apresentar novamente a cada encontro.

Quando comecei, imaginei ingenuamente que a IA manteria o personagem consistente de forma automática. Afinal, a cena anterior tinha acabado de ser gerada, então os dados ainda deveriam estar ali, certo? Depois descobri que eu estava sendo otimista demais. O modelo trata cada prompt como uma tarefa independente, sem estabelecer qualquer relação entre o que veio antes e o que vem depois.

Descrições em texto são imprecisas por natureza

O segundo problema está nos nossos prompts.

Pense na frase “um homem de terno preto”. Quantos resultados visuais diferentes ela pode produzir? Ele pode ter 30 ou 50 anos; pode ser asiático ou europeu; o terno pode ser um modelo italiano de três peças ou uma peça social comum. Diante de uma descrição tão ampla, é natural que a IA entregue algo diferente a cada geração.

É como pedir apenas “um arroz frito” em um restaurante: cada cozinheiro fará um prato diferente. Para o sabor sair sempre igual, você precisa fornecer uma receita precisa — quantos gramas de arroz, quantos ovos, qual marca de molho de soja e quanto tempo no fogo. Com a IA é a mesma coisa: quanto mais detalhada for a descrição, mais estável será o resultado.

A própria tecnologia tem limitações

Há ainda uma razão técnica.

As primeiras gerações de vídeo com IA funcionavam, na prática, quadro a quadro. A IA criava o primeiro quadro, usava esse quadro para gerar o segundo, depois usava o segundo para criar o terceiro… Cada etapa podia introduzir um pequeno desvio. Quando esses desvios se acumulavam, o personagem chegava ao fim do vídeo praticamente irreconhecível.

É como aquela brincadeira de telefone sem fio: a primeira pessoa diz “o dia está bonito” e a última entende “vamos comer alguma coisa à noite”.

Segundo dados de pesquisas do setor, antes do lançamento de modelos como Runway Gen-4 e Veo 3.1, desenvolvidos com atenção específica à consistência dos personagens, a satisfação dos usuários nesse quesito costumava ficar entre 3 e 4 em uma escala de 10. Isso mostra o quanto o problema era comum.

As três principais ferramentas do Veo 3 para manter personagens consistentes

Felizmente, o Google e outras empresas de IA perceberam o problema. O Veo 3 ganhou recursos específicos para melhorar a consistência dos personagens, e o efeito é realmente perceptível. Segundo dados oficiais do Google Flow, esses recursos podem melhorar a consistência em 60% a 70%.

Vou explicar cada um deles.

Ferramenta 1: Reference Images (imagens de referência)

Esse recurso é exclusivo da versão Standard do Veo 3.1. Em termos simples, você envia de uma a três imagens e informa à IA: “Quero que o personagem tenha exatamente esta aparência. Siga a referência com rigor.”

A IA extrai das imagens enviadas as principais características do personagem — formato do rosto, penteado, tom de pele, proporções faciais e assim por diante — e tenta reproduzi-las durante a geração do vídeo.

O recurso é especialmente útil em duas situações:

  • Você quer criar um personagem fictício totalmente novo e precisa definir sua aparência do zero
  • Você quer reproduzir a aparência de uma pessoa específica, como uma figura histórica ou um personagem de romance

Sendo bem sincero, esse recurso também tem limitações. Primeiro, ele só está disponível no modo Standard; a versão básica do Veo 3 não oferece essa opção. Segundo, apesar do bom resultado, ele não faz uma cópia 100% perfeita, então ainda é necessário combinar a referência com uma descrição textual detalhada.

Fiz alguns testes com fotografias de pessoas reais. Os personagens gerados pela IA realmente preservaram as características principais, mas alguns detalhes ainda variaram. A cor dos olhos podia mudar um pouco, por exemplo, e o volume do cabelo nem sempre era o mesmo. Ainda assim, o resultado foi muito melhor do que depender apenas de texto.

Ferramenta 2: Scenebuilder (construtor de cenas)

Este é o recurso que mais uso e do qual mais dependo. Dá para dizer que o Scenebuilder é a principal solução para manter personagens consistentes em vídeos com várias cenas.

Ele funciona assim: as informações visuais da tomada anterior servem de referência para a próxima. É como instalar uma “memória de curto prazo” na IA. Ela não se lembra de todo o histórico, mas ao menos consegue considerar o que acabou de acontecer.

O Scenebuilder tem alguns recursos essenciais:

“Add to Scene” (adicionar à cena)
Quando você gera uma tomada satisfatória, pode clicar nesse botão para adicioná-la a uma linha do tempo. Na prática, é como dizer à IA: “Lembre-se da aparência deste personagem, porque vou usá-lo novamente.”

“Extend” (continuar)
Essa é a principal forma de gerar a tomada seguinte. A opção usa o conteúdo visual anterior para criar uma continuação natural e procura manter a aparência do personagem sem alterações.

“Jump to” (saltar para)
Se você quiser fazer um corte seco — por exemplo, passar de uma cena interna para uma externa —, pode usar essa opção. Ela cria uma transição sem continuidade direta, mas ainda tenta preservar a aparência do personagem.

Nunca vou esquecer a sensação de conseguir gerar, pela primeira vez, cinco tomadas coerentes usando o Scenebuilder. A roupa, o cabelo e as características faciais do personagem permaneceram praticamente iguais. Apenas a iluminação variou um pouco por causa das mudanças de cenário, algo totalmente aceitável.

Casos oficiais do Google Flow mostram que o uso do Scenebuilder pode elevar a consistência dos personagens em 60% a 70%. Em outras palavras, se antes apenas três de cada dez gerações agradavam, agora seis ou sete podem dar certo. É um salto qualitativo enorme.

Ferramenta 3: Ingredients to Video (elementos para vídeo)

Esse recurso funciona melhor em cenas complexas, especialmente quando vários personagens aparecem ao mesmo tempo.

O fluxo de trabalho é o seguinte:

  1. Use primeiro o Gemini 2.5 Flash Image ou outra ferramenta para gerar uma imagem de referência separada para cada personagem e elemento do cenário
  2. Envie esses “ingredientes” ao Veo 3
  3. Use o recurso Ingredients to Video para a IA combinar todos os elementos em uma única cena

A vantagem é que cada personagem tem uma referência visual clara, sem depender da imaginação da IA. Para criar uma conversa entre duas pessoas, por exemplo, você pode gerar primeiro as artes dos personagens A e B separadamente e depois reuni-los na cena com Ingredients to Video.

Eu mesmo não uso esse recurso com tanta frequência, porque o Scenebuilder já atende bem às histórias com um único protagonista. Mas, se você trabalha com interações entre vários personagens, Ingredients to Video é sem dúvida a melhor escolha.

Na prática: como criar um vídeo coerente com o Scenebuilder

Agora que terminamos a parte teórica, vamos à prática. Vou acompanhar você em cada etapa do processo. Mesmo que seja sua primeira vez no Veo 3, basta seguir o passo a passo.

Etapa zero: crie uma “bíblia do personagem”

Essa etapa costuma ser ignorada, mas é a mais importante de todas.

Antes de abrir o Veo 3, reserve de 15 a 30 minutos para escrever um documento detalhado sobre o personagem, conhecido como Character Bible, ou bíblia do personagem. Ele deve incluir:

  • Informações básicas: idade, gênero e etnia
  • Cabelo: comprimento, cor, textura e penteado, como “cabelo preto ondulado até os ombros, repartido ao meio e com as pontas levemente viradas para fora”
  • Rosto: cor dos olhos, formato das sobrancelhas, características do nariz, contorno do queixo e qualquer marca visível, como pintas ou cicatrizes
  • Tipo físico: constituição corporal, impressão de altura e características da postura
  • Roupa: tipo, cor, material e caimento de cada peça, além dos acessórios

Quanto mais detalhes, melhor. Minha sugestão é escrever de 100 a 150 palavras.

Veja um exemplo:

Uma mulher asiática de 28 anos, com cabelo preto, comprido e liso preso em um rabo de cavalo baixo, olhos castanho-escuros, sobrancelhas um pouco grossas, nariz pequeno e queixo arredondado. Ela veste uma camiseta branca de algodão puro, levemente folgada e com gola redonda, combinada com jeans azul-escuro de corte justo e barra dobrada, além de tênis de lona branco. Tem um corpo esguio, mas não excessivamente magro, postura confiante e cabeça ligeiramente erguida. Usa um relógio fino de prata no pulso esquerdo.

Percebeu? A descrição é específica o bastante para deixar pouco espaço para a IA improvisar. Esse é exatamente o objetivo.

Muita gente acha que tanto detalhe dá trabalho. Para ser sincero, dá mesmo. Mas esses 15 minutos podem poupar três horas de novas gerações. É um investimento que compensa.

Etapa 1: gere a tomada de referência

Abra o Google Flow, selecione o Veo 3, cole a descrição completa do personagem e adicione a ação e o cenário da primeira tomada.

Por exemplo:

[Cole a descrição completa do personagem]. Ela está diante de uma cafeteria e empurra a porta de vidro para entrar. Plano médio, com uma leve aproximação da câmera. Luz natural suave, com tons quentes de uma tarde.

Clique em gerar.

Aqui há um ponto essencial: talvez você precise tentar várias vezes até acertar a primeira tomada. Não tenha pressa nem aceite um resultado apenas razoável. A primeira cena será a referência de toda a sequência, e as demais usarão essa aparência como base. Se o personagem já estiver errado no início, tudo o que vier depois ficará comprometido.

Normalmente faço de três a cinco gerações e escolho a melhor. Confira estes pontos:

  • As características faciais correspondem à descrição?
  • Os detalhes das roupas estão corretos?
  • O estilo geral corresponde ao esperado?
  • A qualidade da imagem está boa, incluindo composição e iluminação?

Passe à etapa seguinte somente quando estiver satisfeito com tudo.

Etapa 2: adicione à cena

Abaixo do vídeo aprovado, você verá alguns botões. Clique em “Add to Scene”.

A interface mudará para a visualização da linha do tempo, e o vídeo que você acabou de gerar aparecerá na primeira posição. Parabéns: sua primeira tomada está oficialmente definida.

Parece uma ação simples, mas ela faz algo muito importante: informa ao sistema do Veo 3 que “esta é a aparência padrão do meu personagem; lembre-se dela”.

Etapa 3: adicione uma nova tomada

Na linha do tempo, você verá um sinal de “+”. Clique nele.

O sistema exibirá opções de tomada:

  • Extend (continuar): dá sequência à ação e ao cenário anteriores, com uma transição natural
  • Jump to (saltar para): muda para um novo cenário, mas procura manter a aparência do personagem

Se a próxima cena continuar a mesma ação — por exemplo, ela entra e vai até o balcão fazer o pedido —, escolha Extend.

Se quiser avançar diretamente para outro momento ou cenário — por exemplo, ela já está sentada tomando café —, escolha Jump to.

Na maioria dos casos, eu prefiro Extend, porque a continuidade é melhor.

Etapa 4: escreva o prompt da nova tomada

Esta é uma das etapas mais importantes e também onde mais gente erra.

Muitas pessoas tentam economizar tempo e simplificam o prompt, escrevendo algo como: “Ela vai até o balcão pedir um café.”

Errado. Muito errado.

Embora a IA considere as informações visuais da tomada anterior, a descrição em texto continua sendo sua principal referência. Sem a descrição completa do personagem, o resultado pode se afastar da aparência original.

O correto é copiar e colar a descrição completa do personagem literalmente, alterando apenas a ação e o cenário.

Continuando o exemplo:

[Cole a descrição completa do personagem, exatamente igual à da primeira tomada]. Ela caminha até o balcão de madeira da cafeteria e sorri para o barista. A câmera a acompanha de lado. Mantenha a luz natural suave.

Percebeu? Nem uma palavra da descrição do personagem mudou; apenas a ação e a configuração da câmera foram ajustadas.

Essa é a chamada Verbatim Rule, ou regra literal. Alguns testes indicam que a diferença final de consistência entre uma descrição completa e uma versão simplificada pode chegar a 40%. É o bastante para separar um vídeo “mais ou menos aceitável” de uma sequência com aparência profissional.

Sei que esse processo é repetitivo: copiar, colar e repetir a cada tomada. Mas essa é uma limitação da tecnologia atual. Quando a IA realmente tiver memória de longo prazo, isso deixará de ser necessário. Até lá, o melhor é seguir a regra com rigor.

Etapa 5: gere e confira

Clique em gerar e aguarde de 30 segundos a dois minutos.

Assim que o vídeo estiver pronto, compare as cenas:

  • O cabelo continua igual?
  • A roupa ainda é a mesma?
  • Há alguma diferença evidente nas características faciais?
  • Ainda parece ser a mesma pessoa?

Se a consistência estiver acima de 8 em uma escala de 10, ótimo: você pode aceitar a tomada.

Se ficar entre 6 e 7, com alguns detalhes diferentes, mas mantendo as características principais, você pode aceitá-la ou ajustar o prompt e gerar novamente.

Se estiver abaixo de 5 e a pessoa parecer claramente diferente, não hesite: gere outra vez. Ao fazer isso, não altere a descrição do personagem; ajuste somente o cenário ou a configuração da câmera.

Etapa 6: repita até concluir a cena

Use o mesmo método para adicionar a terceira, a quarta e a quinta tomadas.

Cada vez que adicionar uma nova cena, recomendo reproduzir toda a sequência para verificar a continuidade geral. Às vezes, uma tomada parece boa isoladamente, mas não funciona quando colocada junto das outras.

Também não tente produzir algo longo demais de uma só vez. Cada vídeo do Veo 3 dura de cinco a oito segundos. Uma sequência de cinco a sete tomadas, com cerca de 30 a 50 segundos no total, costuma ser suficiente. Em vídeos mais longos, a consistência tende a cair gradualmente, além de consumir muito tempo e créditos.

Técnicas avançadas, opcionais mas recomendadas

Se quiser melhorar ainda mais a consistência, experimente estas técnicas:

1. Use prompts negativos

Depois da descrição do personagem, acrescente “no hat, no glasses, no beard, no accessories” caso ele não deva ter nenhuma dessas características.

Isso ajuda a impedir que a IA adicione elementos aleatórios. Em um dos meus testes, o personagem não usava óculos nas primeiras cenas, mas apareceu de óculos escuros na quarta tomada, mudando completamente sua presença visual. Depois que adicionei o prompt negativo, o problema não voltou a ocorrer.

2. Mantenha a iluminação consistente

Mudanças bruscas de iluminação afetam o reconhecimento do personagem pela IA. Se você sair de um ambiente interno muito claro diretamente para uma rua escura à noite, a diferença de luz pode levar o modelo a alterar a aparência.

Quando precisar trocar de cenário, tente manter condições de iluminação semelhantes ou use uma tomada de transição para suavizar a mudança.

3. Evite ângulos extremos

Ângulos muito altos ou muito baixos dificultam o reconhecimento das características faciais e podem comprometer as tomadas seguintes.

Nas primeiras cenas, prefira ângulos convencionais na altura dos olhos ou levemente elevados. Experimente perspectivas especiais somente depois que a aparência do personagem estiver bem estabelecida.

4. Crie uma biblioteca de modelos de prompt

Salve as descrições dos personagens que você usa com frequência no Notion, Google Docs ou em qualquer aplicativo de notas. Quando precisar, basta copiar; não reescreva tudo do zero.

Eu mantenho uma biblioteca com cinco ou seis tipos de personagens — homens, mulheres, idosos, crianças e outros. Em cada projeto, escolho um modelo e faço os ajustes necessários. Isso economiza bastante tempo.

Estratégias para gerenciar e otimizar prompts

Agora que vimos como usar o Scenebuilder, vale falar um pouco mais sobre prompts. Muita gente acha que basta escrever qualquer coisa, mas há bastante técnica envolvida.

Estrutura básica de um prompt

Um bom prompt para o Veo 3 deve incluir quatro partes:

[Descrição completa do personagem] + [Ação/cenário] + [Movimento da câmera] + [Estilo/atmosfera]

Veja alguns exemplos:

Exemplo 1: cena simples

Um homem branco de 35 anos, com cabelo castanho curto e alguns fios grisalhos, olhos azuis, barba bem aparada, vestindo terno azul-marinho com camisa branca e gravata vermelho-escura, corpo de porte médio e postura formal. Ele caminha por uma rua da cidade olhando ao redor. Plano médio, com a câmera acompanhando levemente. Luz suave da manhã e atmosfera urbana moderna.

Exemplo 2: conversa em ambiente interno

Uma mulher asiática de 28 anos, com cabelo preto, comprido e liso preso em um rabo de cavalo baixo, olhos castanho-escuros, vestindo camiseta branca e jeans azul-escuro, corpo esguio e postura confiante. Ela está sentada diante de uma mesa de madeira em uma cafeteria, sorri para a câmera e segura uma xícara com as duas mãos. Plano médio fechado frontal, câmera fixa. Luz interna quente e fundo da cafeteria desfocado.

Exemplo 3: cena de ação

Um homem negro de 22 anos, com cabelo curto e cacheado, olhos castanho-escuros, vestindo moletom cinza e calça esportiva preta, corpo atlético e postura de esportista. Ele corre pelo parque em ritmo leve. Travelling lateral, com a câmera acompanhando seu movimento. Luz natural do início da manhã e árvores verdes do parque ao fundo.

Percebeu o padrão? A parte do personagem é sempre a mais detalhada. A ação e o cenário são mais concisos, enquanto a câmera e a atmosfera têm função complementar.

A regra de ouro para descrever personagens

Já destaquei isso várias vezes, mas preciso repetir porque é essencial:

Sempre que gerar uma nova tomada, copie e cole a descrição completa do personagem sem mudar uma única palavra.

Por que tanto rigor? Porque a compreensão de linguagem da IA é probabilística, não exata. Duas expressões que significam a mesma coisa para uma pessoa podem ser entradas ligeiramente diferentes para o modelo e, portanto, produzir resultados ligeiramente diferentes.

Essas pequenas variações talvez passem despercebidas em uma única tomada, mas se acumulam ao longo de cinco ou dez cenas. No fim, você percebe que o personagem voltou a “derivar”.

Portanto, não tente economizar tempo, reescrever ou simplificar. Copie e cole exatamente como está.

Segundo testes com usuários, criadores que seguem a regra literal com rigor alcançam, em média, uma consistência de 8,5 em uma escala de 10. Quem reescreve livremente os prompts fica apenas entre 5 e 6. É uma diferença decisiva.

Técnicas para conectar cenas

Gerar tomadas independentes não é difícil. O desafio é conectá-las de forma natural.

Técnica 1: mantenha a continuidade do ambiente

Se uma tomada acontece em uma cafeteria e a seguinte salta de repente para uma praia, a quebra visual será intensa. A IA também terá mais dificuldade para manter a aparência do personagem.

Sempre que possível, use uma progressão lógica: interior da cafeteria → entrada da cafeteria → rua → parque. Mudanças graduais são processadas com mais estabilidade pela IA.

Técnica 2: use tomadas de transição

Se uma grande mudança de cenário for inevitável, considere incluir uma transição.

Para passar de um ambiente interno a um externo, por exemplo, adicione uma tomada em que “ela abre a porta e a luz do sol entra”. Além de melhorar o efeito visual, isso ajuda a IA a preservar o personagem.

Técnica 3: deixe clara a continuidade temporal

Inclua palavras como “continua” e “depois” no prompt para ajudar a IA a entender que a ação tem sequência.

Exemplo ruim: “Ela está sentada à mesa tomando café.” A ação surge abruptamente.
Exemplo correto: “Ela caminha até a mesa, senta-se e toma um gole de café.” A ação é contínua.

Minha biblioteca pessoal de modelos

Aqui estão alguns modelos que uso com frequência. Você pode copiá-los e adaptar:

Modelo 1: homem urbano contemporâneo

Um homem asiático de 32 anos, com cabelo preto curto penteado cuidadosamente para trás, olhos castanho-escuros, barba por fazer, vestindo suéter cinza de tricô e calça casual preta, corpo bem proporcionado e postura relaxada, mas marcante.

Modelo 2: mulher em ambiente corporativo

Uma mulher branca de 29 anos, com cabelo castanho-dourado ondulado até os ombros, olhos azul-claros, vestindo camisa bege e calça social cinza-escura, além de sapatos pretos de salto baixo, corpo esguio e postura profissional e confiante.

Modelo 3: jovem de estilo urbano

Um homem latino de 19 anos, com cabelo preto de comprimento médio e levemente cacheado, olhos castanho-escuros, vestindo camiseta preta estampada, jeans azul rasgado e tênis branco, corpo alto e magro e postura casual e descontraída.

Basta salvar esses modelos e ajustar os detalhes conforme as necessidades da história. Você pode trocar o penteado ou as roupas, por exemplo, mantendo a estrutura básica.

Problemas comuns e soluções práticas

Depois de criar tantos vídeos, provavelmente já encontrei quase todos os problemas possíveis. É bem provável que você também se depare com alguns deles.

Problema 1: mesmo com o Scenebuilder, o personagem mudou

Sintoma: as duas primeiras tomadas ficam consistentes, mas na terceira ou quarta a aparência começa a se desviar. A cor da roupa muda, o penteado muda e até o formato do rosto deixa de ser o mesmo.

Possíveis causas:

  1. Há pequenas diferenças entre os prompts, talvez porque você tenha simplificado a descrição do personagem
  2. A iluminação ou o cenário mudou demais
  3. O ângulo da câmera é extremo

Solução:

Primeiro, revise os prompts. Abra todos os que você usou e compare, palavra por palavra, a parte dedicada ao personagem. Posso garantir que você encontrará alguma diferença — talvez “terno azul-marinho” tenha virado apenas “terno azul”, ou algum detalhe tenha sido omitido. Padronize a descrição e gere novamente.

Depois, reveja o cenário. Se a segunda tomada acontece em um interior bem iluminado e a terceira pula diretamente para uma rua escura à noite, a diferença de luz pode confundir a IA. Mantenha uma iluminação semelhante ou enfatize no prompt que a aparência do personagem deve permanecer a mesma.

Por fim, verifique o ângulo da câmera. Perspectivas muito altas ou muito baixas podem dificultar o reconhecimento facial. No início, prefira ângulos convencionais e deixe os mais incomuns para quando a aparência já estiver estável.

Em um dos meus projetos, o personagem mudou de repente na quarta tomada. Depois de investigar por um bom tempo, percebi que havia usado um ângulo muito baixo com lente ultra grande angular. A perspectiva deformou o rosto e a IA simplesmente não conseguiu reconhecê-lo. Quando mudei para um ângulo na altura dos olhos, o problema desapareceu.

Problema 2: o meu Veo 3 não tem Reference Images

Sintoma: um tutorial diz que é possível enviar imagens de referência, mas essa opção não aparece na sua interface.

Causa: Reference Images é exclusivo do modo Standard do Veo 3.1. A versão básica e as versões anteriores não oferecem o recurso.

Solução:

Faça upgrade para o plano AI Ultra. Para ser sincero, não é barato: custa US$ 250 por mês. Mas, se você trabalha seriamente com criação de vídeos por IA, o investimento pode valer a pena. A qualidade, a velocidade e os recursos do modo Standard são muito melhores que os da versão básica.

Se não quiser fazer o upgrade agora, tudo bem. Reference Images não é indispensável: o Scenebuilder combinado com descrições detalhadas já produz boa consistência. Em mais da metade dos meus projetos, não usei imagens de referência e ainda assim consegui vídeos coerentes.

Outra alternativa é gerar primeiro uma arte do personagem em ferramentas como Midjourney ou Stable Diffusion, escrever uma descrição textual extremamente detalhada com base nessa imagem e usá-la na geração do vídeo. O resultado não é tão bom quanto enviar a imagem diretamente, mas ainda supera o uso de texto sem referência.

Problema 3: a geração é lenta e custa caro

Sintoma: cada tomada leva de um a dois minutos para ser gerada. Um projeto com cinco cenas exige várias tentativas, consome muitos créditos e ocupa uma noite inteira.

A realidade: sim, é assim que as coisas funcionam hoje. A geração de vídeos com IA ainda é lenta e cara. O problema não está no seu processo, mas no estágio atual da tecnologia.

Mesmo assim, você pode otimizar o fluxo de trabalho:

Estratégia 1: prepare tudo antes de começar
Não abra o Veo 3 e comece a gerar sem planejamento. Reserve uma hora para preparar o roteiro, a descrição do personagem e os prompts de todas as cenas. Confira tudo e só então inicie as gerações. Testes aleatórios são a maior fonte de desperdício de tempo e dinheiro.

Hoje, costumo planejar o projeto inteiro no Notion, incluindo os prompts completos de cinco a sete tomadas em um único documento. Depois, copio e colo tudo de uma vez, reduzindo mudanças improvisadas e ajustes repetitivos.

Estratégia 2: use ferramentas de menor custo na preparação
Antes de trabalhar no Veo 3, desenvolva o personagem com ferramentas gratuitas ou mais baratas.

Você pode usar o Whisk, ferramenta gratuita do Google, para gerar artes do personagem, ou Leonardo.ai e Ideogram para criar referências de cenários. Defina visualmente a aparência antes de animá-la no Veo 3; assim, a taxa de sucesso tende a aumentar bastante.

Estratégia 3: gere apenas as tomadas essenciais
Nem todas as cenas precisam ser produzidas no Veo 3. Algumas transições e planos abertos menos importantes podem ser gerados em ferramentas mais baratas, como Pika ou a versão básica do Runway, ou até substituídos por imagens reais.

Concentre o orçamento nas cenas que realmente exigem closes do personagem ou ações importantes.

Em um projeto anterior, havia sete tomadas: três closes do personagem, dois diálogos em plano médio e dois planos abertos do ambiente. Produzi as cinco primeiras com cuidado no Veo 3 e usei vídeos gratuitos do Pexels nas duas últimas. O resultado final não pareceu estranho, e o custo caiu pela metade.

Problema 4: manter vários personagens é ainda mais difícil

Desafio: sua história tem dois ou até três protagonistas, e preservar a aparência de todos parece uma missão impossível.

Por que é tão difícil:

Cada personagem precisa de uma descrição detalhada, deixando o prompt enorme. O Veo 3 tem limite de comprimento e pode cortar um texto excessivamente longo. Além disso, quanto mais personagens houver, maior será a chance de a IA misturar suas características.

Solução:

Defina prioridades
Estabeleça quem é principal e quem é coadjuvante. Se houver um protagonista e um personagem secundário, dedique 80% do esforço ao primeiro e aceite um pouco mais de variação no segundo. A atenção do público está concentrada no protagonista, e pequenas diferenças no coadjuvante costumam passar despercebidas.

Use Ingredients to Video
Essa é a melhor ferramenta para cenas com vários personagens. Gere primeiro uma imagem de referência separada de cada um, usando Gemini 2.5 Flash Image ou Midjourney, e depois reúna tudo com Ingredients. Como cada personagem tem uma âncora visual clara, é mais difícil a IA confundi-los.

Filme em tomadas separadas
Evite, sempre que possível, colocar vários personagens no mesmo quadro. Use uma montagem: quando A fala, mostre o close de A; quando B responde, corte para o close de B. Assim, cada tomada precisa lidar com apenas uma pessoa e o problema de consistência cai pela metade.

Vi um caso muito inteligente em que o criador produziu um curta com uma conversa entre duas pessoas sem jamais mostrar as duas no mesmo quadro. O vídeo alternava closes individuais combinados com falas em off. O público não percebia a limitação técnica; pelo contrário, o ritmo de edição parecia bastante profissional.

Para concluir

Depois de tudo isso, quero falar com sinceridade.

A consistência dos personagens realmente é um dos maiores desafios da geração de vídeos com IA. Mesmo com ferramentas como Scenebuilder e Reference Images, não há como chegar a 100% de perfeição. Algumas gerações ainda falharão, novas tentativas continuarão sendo necessárias e você ainda poderá se frustrar de vez em quando.

Mas, com um método sistemático — bíblia do personagem detalhada, gestão rigorosa dos prompts e uso correto do Scenebuilder —, é totalmente possível elevar a consistência de 3 para 8 pontos. Essa diferença basta para transformar uma obra que “parece gerada por IA” em algo com aparência de produção profissional.

Levei cerca de duas semanas e mais de cem testes de geração para passar do caos inicial à produção estável de vídeos coerentes com várias tomadas. Se minha experiência ajudar você a evitar alguns desses erros, este artigo já terá cumprido seu papel.

Por fim, aqui vai uma sugestão prática: comece com um projeto pequeno.

Não tente produzir um curta de dez minutos logo de início. Faça primeiro uma cena muito curta, com apenas duas ou três tomadas, para praticar. Familiarize-se com o processo, ganhe confiança e monte seus modelos. Quando conseguir criar três cenas consistentes com regularidade, passe para cinco e depois para sete.

Roma não foi construída em um dia, e nenhuma habilidade é dominada na primeira tentativa.

É isso. Abra o Google Flow, crie sua primeira bíblia do personagem e comece a testar. Se tiver dúvidas ou quiser compartilhar um caso de sucesso, deixe um comentário. Também quero ver o que você conseguiu criar.

Boa geração — e que seus personagens permaneçam sempre consistentes.

FAQ

Por que os personagens mudam tanto nos vídeos gerados por IA?
Há três motivos principais:

1) A IA não tem memória de longo prazo, e cada prompt é tratado como uma tarefa independente

2) As descrições em texto não são precisas, e descrições genéricas geram resultados diferentes

3) Há limitações técnicas, pois os desvios podem se acumular durante a geração quadro a quadro

Ferramentas como o Scenebuilder podem melhorar a consistência de 60% a 70%.
Como usar o Scenebuilder para manter a consistência do personagem?
Fluxo em 6 etapas:

1) Crie uma bíblia do personagem, com uma descrição detalhada de 100 a 150 palavras

2) Gere uma cena de referência, fazendo de 3 a 5 tentativas e escolhendo a melhor

3) Adicione-a à cena clicando em Add to Scene

4) Adicione uma nova tomada, escolhendo Extend ou Jump to

5) Repita a descrição completa do personagem, copiando e colando literalmente

6) Gere e confira; uma consistência acima de 8 pontos é aceitável
Por que é preciso repetir a descrição completa do personagem?
Essa é a regra literal, ou Verbatim Rule.

Comparação dos resultados:
• A diferença de consistência entre uma descrição completa e uma versão simplificada pode chegar a 40%
• Criadores que seguem a regra rigorosamente chegam a uma consistência de 8,5 pontos
• Reescritas livres alcançam apenas 5 a 6 pontos

O motivo é que a interpretação da linguagem pela IA é probabilística; pequenas alterações em uma expressão podem gerar resultados diferentes.
Onde fica o recurso Reference Images?
Reference Images é exclusivo do modo Standard do Veo 3.1 e exige uma assinatura AI Ultra, de US$ 250 por mês.

Se você não quiser fazer o upgrade, pode usar:
• Scenebuilder com uma descrição textual detalhada
• Outra ferramenta para criar primeiro uma arte de referência do personagem e depois escrever uma descrição detalhada
Como manter a consistência quando vários personagens aparecem juntos?
Três estratégias:

1) Defina prioridades e dedique 80% do esforço ao protagonista

2) Use Ingredients to Video, criando primeiro uma imagem de referência para cada personagem e depois reunindo todos

3) Filme em tomadas separadas, evitando vários personagens no mesmo quadro e tratando cada um individualmente com uma montagem
Como reduzir o custo de geração e trabalhar com mais eficiência?
Três estratégias:

1) Prepare tudo antes de começar e escreva todos os prompts com antecedência

2) Use ferramentas de menor custo para a preparação, como Whisk e Leonardo.ai para criar artes de referência

3) Gere apenas as cenas principais e use ferramentas mais baratas ou imagens reais nas transições

Quinze minutos investidos na bíblia do personagem podem economizar três horas de novas gerações.

25 min de leitura · Publicado em: 7 dez 2025 · Atualizado em: 4 set 2026

Comentários

Entre com GitHub para comentar

Easton BlogEaston Blog