Changer le thème

Cohérence des personnages Veo 3 : guide Scenebuilder pour des vidéos multi-plans

Easton editorial illustration: permission gate hub

La première fois que j’ai généré une vidéo multi-plans avec Veo 3, j’avais soigneusement préparé un script de cinq plans. J’attendais beaucoup de chaque génération. Résultat ? Au premier plan, le héros avait les cheveux noirs courts et un costume bleu ; au deuxième, cheveux châtains longs et sweat gris ; au troisième, même le visage avait changé — on aurait dit une autre personne.

Si vous avez vécu ça, vous n’êtes pas seul. L’incohérence d’apparence est l’une des frustrations les plus courantes en vidéo IA. Après de nombreux tests, j’ai trouvé une méthode qui tient la route. Cet article rassemble tout ce que j’ai appris.

Pourquoi les personnages « dérivent » en vidéo IA ?

Avant les solutions, comprenons le problème : pourquoi l’apparence change-t-elle ? Une fois la cause identifiée, on peut agir au bon endroit.

L’IA n’a pas de mémoire durable

C’est le cœur du problème. Veo 3, Runway et les autres modèles de vidéo IA partagent une limite majeure : pas de mémoire à long terme.

Concrètement : si le premier plan montre un homme en costume noir, l’IA ne « retient » pas ce visage. Le plan suivant est une nouvelle tâche — comme parler à quelqu’un qui vous oublie à chaque phrase.

Au début, je pensais que la cohérence serait automatique : le plan précédent venait d’être généré, les données devaient encore être là. Erreur. Chaque prompt est traité indépendamment, sans lien avec les plans précédents.

Le texte reste imprécis

Le deuxième problème vient des prompts.

« Un homme en costume noir » — combien de rendus possibles ? 30 ou 50 ans, traits asiatiques ou européens, costume trois pièces ou veste de bureau… Face à une description large, l’IA varie naturellement.

Comme commander « un plat de riz sauté » sans recette : chaque cuisinier sort une version différente. Pour une sortie stable, il faut une fiche précise — grammes, œufs, marque de sauce, temps de cuisson. Plus la description est détaillée, plus le résultat est stable.

Des limites techniques aussi

Il y a aussi la génération plan par plan : la frame 1 sert à la frame 2, puis à la 3… Chaque étape introduit un léger écart ; à la fin du clip, le personnage peut avoir dérivé.

Comme le jeu du téléphone arabe : « Il fait beau » devient parfois « On mange des nouilles ce soir ».

Avant les modèles optimisés pour la cohérence (Runway Gen-4, Veo 3.1, etc.), la satisfaction utilisateur tournait souvent autour de 3-4/10 sur ce critère. Le problème est massif.

Les trois leviers de cohérence de Veo 3

Google et d’autres acteurs ont ajouté des fonctions dédiées. Sur les données officielles de Google Flow, la cohérence peut progresser de 60 à 70 % avec ces outils.

Levier 1 : Reference Images

Fonction propre à Veo 3.1 en mode Standard : téléverser 1 à 3 images pour dire à l’IA « le personnage doit ressembler à ça ».

L’IA extrait visage, coiffure, teint, proportions, puis tente de les reproduire dans la vidéo.

Idéal pour :

  • un personnage fictif créé from scratch ;
  • reproduire une apparence cible (personnage historique, héros de roman).

Limites : Standard uniquement, pas le Veo 3 de base ; ce n’est pas une copie parfaite à 100 % — une description textuelle détaillée reste utile.

Avec une photo réelle, j’ai obtenu les traits principaux, mais parfois une nuance sur les yeux ou le volume des cheveux. Déjà bien mieux que le texte seul.

Levier 2 : Scenebuilder

C’est celui que j’utilise le plus. Pour moi, Scenebuilder est la solution centrale pour des séries multi-plans cohérentes.

Principe : le plan précédent sert de référence visuelle pour le suivant. Une sorte de « mémoire courte » : pas tout l’historique, mais au moins le plan qu’on vient de verrouiller.

Fonctions clés :

Add to Scene
Quand un plan vous convient, ce bouton l’ajoute à la timeline. Message implicite à l’IA : « retiens cette apparence, je vais la réutiliser ».

Extend
Mode principal pour le plan suivant : enchaînement naturel en s’appuyant sur le visuel précédent, avec effort pour garder la même apparence.

Jump to
Pour une coupure nette (intérieur → extérieur) tout en visant la même apparence du personnage.

La première fois que cinq plans sont restés cohérents (tenue, cheveux, visage), la différence était flagrante. Seule la lumière bougeait un peu selon la scène — acceptable.

Officiellement : +60 à 70 % de cohérence. Si vous aviez 3 essais satisfaisants sur 10, vous pouvez viser 6-7. C’est un saut qualitatif.

Levier 3 : Ingredients to Video

Plutôt pour les scènes complexes, surtout plusieurs personnages en même temps.

Workflow :

  1. Générer séparément chaque personnage et élément de décor (Gemini 2.5 Flash Image, etc.) ;
  2. Téléverser ces « ingrédients » dans Veo 3 ;
  3. Composer la scène avec Ingredients to Video.

Chaque personnage a une ancre visuelle ; l’IA n’invente pas tout depuis le texte. Pour un dialogue à deux, générez A et B puis composez.

Pour une histoire à un seul héros, Scenebuilder suffit souvent. Multi-personnages : Ingredients to Video est le meilleur choix.

Pratique : créer une vidéo cohérente avec Scenebuilder

Passons à l’action. Voici le flux complet — même en première utilisation de Veo 3, vous pouvez suivre pas à pas.

Étape 0 : la bible du personnage

Souvent négligée, c’est pourtant la plus importante.

Avant d’ouvrir Veo 3, prenez 15 à 30 minutes pour un document détaillé — la Character Bible. Contenu suggéré :

  • Base : âge, genre, origine ethnique si pertinent ;
  • Cheveux : longueur, couleur, texture, coiffure ;
  • Visage : yeux, sourcils, nez, mâchoire, signes distinctifs ;
  • Silhouette : morphologie, posture ;
  • Tenue : chaque vêtement, couleur, matière, coupe, accessoires.

Visez 100 à 150 mots.

Exemple :

Femme asiatique de 28 ans, cheveux noirs lisses en queue basse, yeux marron foncé, sourcils légèrement épais, petit nez, menton arrondi. T-shirt blanc en coton (coupe légèrement ample, col rond), jean bleu foncé (slim, ourlets relevés), baskets blanches. Silhouette fine mais pas frêle, posture confiante, tête légèrement haute. Montre fine argentée au poignet gauche.

Assez précis pour limiter l’interprétation libre de l’IA. Oui, c’est un peu long — mais 15 minutes ici peuvent éviter 3 heures de régénérations.

Étape 1 : le plan de référence

Ouvrez Google Flow, choisissez Veo 3, collez la description complète du personnage, ajoutez action et décor du premier plan.

Exemple :

[Description complète du personnage]. Elle est devant un café, pousse la porte vitrée et entre. Plan moyen, léger travelling avant. Lumière naturelle douce, ambiance après-midi chaleureuse.

Générez.

Point clé : le premier plan demande souvent plusieurs essais. Ne vous précipitez pas. C’est la référence de toute la série : si le personnage est faux dès le départ, la suite est compromise.

Je fais en général 3 à 5 essais et je vérifie :

  • traits du visage ;
  • détails des vêtements ;
  • style global ;
  • qualité image (cadrage, lumière).

Quand tout est bon, passez à l’étape suivante.

Étape 2 : ajouter à la scène

Sous la vidéo validée, cliquez sur Add to Scene.

L’interface passe en vue timeline ; votre clip est en première position. Le premier plan est verrouillé.

Simple en apparence, mais crucial : vous dites au système « voici l’apparence standard du personnage ».

Étape 3 : ajouter un nouveau plan

Sur la timeline, cliquez sur +.

Choix :

  • Extend : suite naturelle du plan précédent ;
  • Jump to : nouvelle scène, même apparence visée.

Enchaînement d’action (elle entre puis va au comptoir) → Extend.

Saut de lieu (elle est déjà assise avec son café) → Jump to.

Je privilégie Extend pour la fluidité.

Étape 4 : rédiger le prompt du nouveau plan

Là où la plupart des gens se trompent.

Erreur classique : raccourcir — « Elle va au comptoir commander un café. »

Non. Le texte reste le pilier principal. Sans description complète du personnage, l’IA peut dériver.

Bonne pratique : recopier mot pour mot la bible du personnage, ne changer que l’action et le cadrage.

[Même description qu’au plan 1, identique]. Elle marche vers le comptoir en bois, sourit au barista. Travelling latéral. Même lumière naturelle douce.

C’est la Verbatim Rule. Les tests montrent jusqu’à 40 % d’écart entre description complète et version raccourcie — différence entre « ça passe » et « rendu pro ».

Copier-coller, encore copier-coller… Tant que l’IA n’aura pas une vraie mémoire longue, c’est le prix à payer.

Étape 5 : générer et contrôler

Générez (30 secondes à 2 minutes).

Comparez immédiatement :

  • coiffure ;
  • tenue ;
  • traits du visage ;
  • impression globale « même personne ».

8/10 ou plus : vous pouvez valider.

6-7/10 : détails un peu faux mais reconnaissable — accepter ou retenter.

5/10 ou moins : regénérez sans toucher à la description du personnage ; ajustez seulement scène ou caméra.

Étape 6 : enchaîner les plans

Même méthode pour les plans 3, 4, 5…

Après chaque ajout, rejouez la séquence entière : parfois un plan isolé semble correct mais la suite révèle une dérive.

Ne visez pas une durée excessive : un clip Veo 3 fait 5-8 secondes ; 5 à 7 plans (environ 30-50 secondes) est un bon plafond avant baisse de cohérence et coût en crédits.

Astuces avancées (recommandées)

1. Prompts négatifs
Ajoutez par exemple : no hat, no glasses, no beard, no accessories si le personnage n’en a pas — pour éviter des ajouts aléatoires (lunettes de soleil au plan 4, etc.).

2. Lumière stable
Un passage brutal intérieur clair → nuit dehors peut faire « perdre » le personnage. Gardez des conditions proches ou insérez un plan de transition.

3. Éviter les angles extrêmes
Plongée ou contre-plongée forte : l’IA lit mal le visage. Commencez en angle classique, expérimentez ensuite.

4. Bibliothèque de modèles
Stockez vos descriptions dans Notion, Google Docs, etc. Ne retapez pas à chaque projet. J’ai 5-6 archétypes (homme, femme, senior, enfant…) que j’adapte — gain de temps énorme.

Gestion et optimisation des prompts

Scenebuilder couvre le flux ; les prompts méritent leur propre discipline.

Structure d’un bon prompt Veo 3

Quatre blocs :

[Description complète du personnage] + [Action / scène] + [Mouvement de caméra] + [Style / ambiance]

Exemple 1 — rue

Homme blanc de 35 ans, cheveux courts châtains légèrement grisonnants, yeux bleus, barbe soignée, costume bleu foncé, chemise blanche, cravate bordeaux, silhouette moyenne, posture formelle. Il marche en ville et regarde autour de lui. Plan moyen, léger travelling. Lumière matinale douce, ambiance urbaine moderne.

Exemple 2 — dialogue intérieur

Femme asiatique de 28 ans, cheveux noirs lisses en queue basse, yeux marron foncé, T-shirt blanc et jean bleu foncé, silhouette fine, posture confiante. Assise à une table en bois de café, elle sourit à la caméra, tient sa tasse à deux mains. Plan moyen rapproché face, caméra fixe. Lumière intérieure chaude, arrière-plan flou.

Exemple 3 — action

Homme noir de 22 ans, cheveux courts bouclés, yeux marron foncé, sweat à capuche grise et jogging noir, silhouette athlétique. Il court dans un parc, foulée légère. Travelling latéral suivant le sujet. Lumière matinale, arbres en arrière-plan.

Le personnage est toujours le bloc le plus long ; action et caméra restent plus courts.

La règle d’or

Encore une fois, car c’est décisif :

À chaque nouveau plan, recopiez la description du personnage sans changer un mot.

L’IA ne lit pas le langage comme nous. « T-shirt blanc » et « T-shirt de couleur blanche » peuvent être deux entrées légèrement différentes. Sur 5 ou 10 plans, l’écart grossit.

Ne raccourcissez pas, ne reformulez pas. Copier-coller.

Les créateurs stricts tournent autour de 8,5/10 ; ceux qui simplifient les prompts : 5-6/10.

Enchaîner les scènes

Continuité de décor
Café → plage d’un coup : rupture forte et risque de dérive. Préférez une progression logique : intérieur café → porte → rue → parc.

Plans de transition
Pour un grand saut de lieu : « elle ouvre la porte, la lumière du soleil entre » — meilleur pour l’œil et pour la cohérence.

Marquer la continuité temporelle
Utilisez « puis », « ensuite », « continue de… » plutôt qu’une action isolée sans lien.

Mauvais : « Elle est assise et boit son café. »
Bon : « Elle s’assoit à la table, prend la tasse et boit une gorgée. »

Modèles prêts à l’emploi

Modèle 1 — homme urbain

Homme asiatique de 32 ans, cheveux noirs courts coiffés en arrière, yeux marron foncé, légère barbe de trois jours, pull gris et pantalon noir, silhouette équilibrée, posture détendue mais assurée.

Modèle 2 — femme pro

Femme blanche de 29 ans, cheveux châtains dorés ondulés aux épaules, yeux bleu clair, chemise beige et pantalon gris foncé, escarpins noirs bas, silhouette fine, posture professionnelle confiante.

Modèle 3 — jeune en rue

Homme latino de 19 ans, cheveux noirs mi-longs légèrement bouclés, yeux marron foncé, T-shirt noir imprimé, jean bleu déchiré, baskets blanches, silhouette élancée, posture décontractée.

Adaptez coiffure et tenue ; le squelette reste réutilisable.

Problèmes fréquents et solutions

Problème 1 : Scenebuilder utilisé, mais le personnage change quand même

Signes : plans 1-2 corrects, dérive à partir du 3e ou 4e (couleur des vêtements, coiffure, visage).

Causes possibles :

  1. micro-différences dans les prompts ;
  2. changement brutal de lumière ou de décor ;
  3. angle de caméra extrême.

Actions :

  • comparez mot pour mot toutes les descriptions personnage (« costume bleu foncé » vs « costume bleu », détail manquant…) ;
  • harmonisez la lumière ou ajoutez « garder la même apparence du personnage » ;
  • évitez grand-angle en plongée/contre-plongée au début — un projet mien a déraillé au plan 4 à cause d’une contre-plongée qui déformait le visage ; repasser en plan neutre a tout réglé.

Problème 2 : pas de Reference Images dans mon interface

Cause : fonction réservée à Veo 3.1 Standard — pas sur la version de base ou ancienne.

Options :

  • abonnement AI Ultra (~250 $/mois) si vous produisez sérieusement ;
  • sinon Scenebuilder + texte détaillé suffit souvent — une grande partie de mes projets n’utilise pas Reference Images ;
  • alternative : planche personnage via Midjourney ou Stable Diffusion, puis description ultra précise dérivée de l’image.

Problème 3 : lent et coûteux

Réalité : 1-2 minutes par plan, beaucoup d’essais — c’est l’état actuel de la techno, pas une faute de workflow.

Optimisations :

  • Préparer avant Veo 3 : script, bible, tous les prompts dans Notion — une heure de prep évite les corrections à chaud ;
  • Outils gratuits ou bon marché en amont : Whisk, Leonardo.ai, Ideogram pour verrouiller le look ;
  • Plans clés seulement : transitions ou plans larges avec Pika, Runway basique ou rush Pexels — sur un projet de 7 plans, j’ai fait 5 en Veo 3 et 2 en stock ; au montage, personne ne voyait la différence, budget divisé.

Problème 4 : plusieurs personnages, encore plus dur

Chaque personnage alourdit le prompt ; au-delà d’une certaine longueur, troncature possible. Plus il y a de visages, plus l’IA mélange.

Stratégies :

  • Priorité : 80 % d’effort sur le héros, tolérance plus large sur le second rôle ;
  • Ingredients to Video : une référence par personnage puis composition ;
  • Un personnage par plan : monter en alternance de gros plans, voix off — un créateur a fait un dialogue « pro » sans jamais montrer les deux dans le même cadre.

Pour conclure

La cohérence des personnages reste l’un des plus gros défis de la vidéo IA. Même avec Scenebuilder et Reference Images, ce n’est pas 100 % parfait : échecs, nouvelles tentatives, moments de frustration.

Mais avec une bible détaillée, des prompts gérés strictement et Scenebuilder bien utilisé, vous pouvez passer de ~3/10 à ~8/10 — assez pour que le rendu paraisse « produit » plutôt que « clairement IA ».

De mon côté, deux semaines et des centaines de générations m’ont amené là. Si cet article vous fait gagner du temps, il a fait son job.

Conseil pour commencer : petit projet.

Pas un court-métrage de 10 minutes d’emblée. Deux ou trois plans, pour apprendre le geste, constituer des modèles. Quand trois plans stables deviennent routine, passez à cinq, puis sept.

Rome ne s’est pas faite en un jour ; la maîtrise non plus.

Ouvrez Google Flow, rédigez votre première bible du personnage, et lancez-vous. Des questions ou des réussites ? Partagez-les en commentaire — j’aimerais voir ce que vous produisez.

Bonne génération — et que vos personnages restent les mêmes.

FAQ

Pourquoi les personnages changent-ils d'un plan à l'autre en vidéo IA ?
Trois causes principales :

1) L'IA n'a pas de mémoire à long terme : chaque prompt est une tâche indépendante

2) Les descriptions textuelles sont imprécises : des formulations vagues produisent des variantes

3) Limites techniques : en génération image par image, les écarts s'accumulent

Des outils comme Scenebuilder peuvent améliorer la cohérence de 60 à 70 %.
Comment utiliser Scenebuilder pour garder un personnage cohérent ?
Workflow en 6 étapes :

1) Créer une bible du personnage (description détaillée de 100 à 150 mots)

2) Générer le plan de référence (3 à 5 essais, garder le meilleur)

3) Ajouter à la scène (cliquer sur Add to Scene)

4) Ajouter un nouveau plan (Extend ou Jump to)

5) Répéter intégralement la description du personnage (copier-coller mot pour mot)

6) Générer et contrôler (8/10 ou plus, c'est acceptable)
Pourquoi faut-il répéter la description du personnage à l'identique ?
C'est la règle du mot pour mot (Verbatim Rule).

Comparaison :
• Écart de cohérence pouvant atteindre 40 % entre description complète et simplifiée
• Créateurs stricts : ~8,5/10 en moyenne
• Reformulations libres : ~5-6/10

Raison : l'IA interprète le langage de façon probabiliste ; « T-shirt blanc » et « T-shirt de couleur blanche » peuvent produire des sorties différentes.
Où se trouve la fonction Reference Images ?
Reference Images est réservée au mode Veo 3.1 Standard et nécessite l'abonnement AI Ultra (250 $/mois).

Sans upgrade :
• Scenebuilder + description textuelle détaillée
• Générer d'abord une planche personnage avec un autre outil, puis décrire précisément
Comment gérer plusieurs personnages dans la même scène ?
Trois stratégies :

1) Prioriser : consacrer 80 % de l'effort au personnage principal

2) Utiliser Ingredients to Video : générer chaque référence séparément puis composer

3) Tourner en plans séparés : éviter deux personnages dans le même cadre, monter en alternance
Comment réduire les coûts et gagner en efficacité ?
Trois stratégies :

1) Préparer avant de générer : rédiger tous les prompts à l'avance

2) Outils peu coûteux en amont (Whisk, Leonardo.ai pour les planches personnage)

3) Ne générer en Veo 3 que les plans clés ; transitions avec outils moins chers ou rush réel

15 minutes sur une bible du personnage peuvent économiser 3 heures de régénérations.

12 min de lecture · Publié le: 7 déc. 2025 · Mis à jour le: 27 juil. 2026

Commentaires

Connectez-vous avec GitHub pour laisser un commentaire

Easton BlogEaston Blog