Guide complet de la génération audio Veo 3 : doublage et musique automatiques pour vos vidéos IA (modèles de prompts inclus)

Veo 3 n’ajoute pas automatiquement de son à vos vidéos. Même si votre prompt contient "A woman says: 'Hello'", sans le bon mode qualité ou une description audio suffisamment explicite, la vidéo générée restera muette.
Lors de l’I/O 2025, Google a mis en avant le support audio natif de Veo 3 : dialogues, effets sonores et musique de fond peuvent être générés en synchronisation avec l’image. Mais cette capacité n’est pas activée par défaut — il faut préciser qui dit quoi, quels sons accompagnent la scène, et qui parle en premier dans les dialogues multi-voix. La synchronisation labiale atteint environ 80 % en solo, tombe sous 40 % en multi-voix, et le chinois n’atteint que 30 %.
Cet article décortique la logique complète de la génération audio Veo 3, propose des modèles de prompts pour dialogues, effets et musique, ainsi que des méthodes de dépannage pour 5 problèmes fréquents.
La révolution audio Veo 3 : fini l’ère du muet
Qu’est-ce que la génération audio native
Le workflow classique de la vidéo IA : d’abord l’image, puis trouver des comédiens, enregistrer, créer les effets, mixer — l’équipe Promise Studios estime la durée moyenne à 4 heures.
Veo 3 compresse tout cela en 3 minutes.
Il utilise une « architecture dual-stream » (en clair : vidéo et audio générés simultanément et alignés automatiquement). Vous saisissez un prompt, l’IA dessine l’image et mixe le son en parallèle — la bouche du personnage suit naturellement la voix, les sons d’ambiance correspondent à l’image : pluie = bruit de pluie, parquet = pas qui résonnent.
Point clé : les capacités audio de Veo 3 se répartissent en trois catégories qu’il faut distinguer :
1. Dialogue
Ce que dit un personnage ou un narrateur. Ton, accent et émotion sont contrôlables.
2. Sound Effects (effets sonores)
Sons concrets de la scène : sonnerie de téléphone, éclaboussure d’eau, porte qui grince.
3. Ambient Noise (sons d’ambiance)
Arrière-plan qui rend la scène crédible : trafic urbain, vagues sur le rivage, bourdonnement de climatisation au bureau.
Mise à jour audio Veo 3.1 (octobre 2025)
Le 14 octobre 2025, Google a publié Veo 3.1 avec une nette amélioration de la qualité audio.
Mon test comparatif : avec Veo 3, la voix « flotte » parfois — un demi-battement de décalage avec la bouche. Veo 3.1 corrige largement ce problème et supporte désormais les dialogues multi-voix — deux personnages qui parlent à tour de rôle, sans chaos.
Autre mise à jour utile : auparavant, seul le text-to-video permettait l’audio ; désormais l’image-to-video (upload d’image), l’extension de frames (prolongation) et d’autres modes le supportent aussi.
À noter : l’audio Veo 3.1 ressemble davantage à un « first draft » (première ébauche). La communauté estime le naturel à 92 % d’un enregistrement humain, mais pour un projet professionnel, un passage en post-production reste nécessaire. À 0,75 $/seconde, l’utiliser tel quel comme livrable final reste risqué.
Principes clés des prompts audio : la clarté fait la différence
Pourquoi des vidéos sans son
Au début avec Veo 3, environ 70 % de mes vidéos étaient muettes. Pas un bug de l’IA — des prompts trop vagues.
La logique de Veo 3 : il n’ajoute pas l’audio de lui-même. Si vous ne le demandez pas, il suppose que vous voulez une vidéo muette.
Exemple : « A woman walking in the rain. »
Veo 3 génère fidèlement une femme marchant sous la pluie — sans pluie, sans pas, rien.
Il faut écrire : « A woman walking in the rain. Audio: rain pattering on pavement, footsteps splashing through puddles. »
Là, il comprend : pluie et pas souhaités.
Autre piège : dans Flow, réglez le mode qualité sur « Highest Quality ». Le mode aperçu par défaut ne génère pas l’audio. J’ai perdu dix essais avant de comprendre que c’était un problème de réglage.
Stratégies de prompt pour les trois types d’audio
Dialogue : un format fixe pour de bons résultats
Formule simple : description du personnage + action + dialogue entre guillemets
❌ Mauvais exemple :
« A woman says hello. » (trop vague, l’IA ne sait pas quoi dire)
✅ Bon exemple :
« The woman smiles and says, ‘Welcome to Veo 3.’ »
Pour contrôler le ton, ajoutez des modificateurs émotionnels :
- angrily (avec colère)
- nervously (nerveusement)
- softly (doucement)
- excitedly (avec enthousiasme)
Exemple complet :
« The man leans forward and says angrily, ‘Where is my coffee?’ »
Effets sonores : action + description du son
Soyez précis sur les détails sonores.
❌ Exemple vague :
« a phone » (l’IA ne sait pas ce que fait le téléphone)
✅ Exemples précis :
« the sound of a phone ringing »
« water splashing in the background »
« soft house sounds, the creak of a closet door, and a ticking clock »
Astuce : liez l’effet à l’action visuelle avec « as », « when ».
« As the door creaks open, a gust of wind rushes in. »
Le lien causal entre son et image devient clair.
Sons d’ambiance : scène + couches sonores
Décrivez la « profondeur », sinon le rendu sonne plat.
❌ Exemple plat :
« city sounds » (trop général)
✅ Exemples stratifiés :
« the sounds of city traffic and distant sirens » (trafic proche + sirènes lointaines)
« waves crashing on the shore » (effet principal)
« the quiet hum of an office » (bruit de fond)
Techniques de description audio spatiale
Technique avancée, mais très utile.
L’oreille perçoit la position : proche = net, lointain = atténué. Veo 3 comprend aussi — à condition de le lui dire.
Mots pour la spatialisation :
- in the distance (au loin)
- cuts through (traverse, effet dominant)
- somewhere above (quelque part au-dessus)
- faintly (faiblement)
- echoing (en écho)
Exemple complet (testé avec succès) :
Rain falls steadily onto wet pavement, pattering softly across rooftops and metal bins.
A single, low thunderclap rolls across the sky, echoing faintly between tall buildings.
A car passes faintly in the distance. A dog barks once.
A soft, tense melody plays from an old radio somewhere above.
On y trouve :
- Premier plan : pluie sur le sol
- Plan intermédiaire : tonnerre en écho lointain
- Arrière-plan : voiture, aboiement
- Atmosphère : radio au-dessus
Veo 3 interprète très bien ce type de description stratifiée.
Dialogue en pratique : faire parler les personnages
Bonnes pratiques pour un seul locuteur
La génération de dialogue est la partie la plus délicate de l’audio Veo 3. Pas techniquement difficile — beaucoup de règles.
Première règle d’or : dialogues courts, une phrase, moins de 8 secondes.
J’ai tenté de longs monologues : répliques perdues ou synchronisation labiale chaotique. Veo 3 gère mal les longs dialogues. Découpez en segments ou tenez-vous à une phrase.
Deuxième règle : émotion + action + langue, les trois ensemble.
❌ Exemple plat :
« He says, ‘Did you hear that?’ »
✅ Exemple avec tension :
« He bursts into wild laughter, head thrown back. Mid-laugh, he stops, eyes widening in terror, then whispers softly: ‘Did you hear that?’ »
La différence : le processus émotionnel est décrit — rire → arrêt → peur → chuchotement. Veo 3 reproduit ces transitions avec un réalisme saisissant.
Troisième règle : cohérence du personnage.
Pour plusieurs segments, réutilisez la même description. « a woman in a red coat with short black hair » doit être identique dans chaque prompt, sinon l’IA change de personnage — et de voix.
Dialogues multi-personnages
Deux personnes qui parlent en même temps — le scénario cauchemar de l’audio Veo 3.
J’ai essayé un script direct :
Man: "What are you doing?"
Woman: "None of your business."
Résultat désastreux : une seule voix, ou dialogues décalés par rapport à l’image.
La bonne approche : pas de script dialogue, mais un flux de scène.
✅ Exemple efficace :
« Inside a cluttered garage, two teenage friends argue over a broken time machine. One leans over the table, frustrated and loud. The other avoids eye contact, mumbling and fiddling with wires. Rain hits the roof, and the lights flicker. »
La logique : faire comprendre « deux personnes se disputent », pas « A dit ceci, B dit cela ». Veo 3 décide qui parle, quand et comment.
Honnêtement, le taux de réussite multi-voix reste inférieur au solo. Pour des dialogues complexes, un locuteur par segment, puis montage en post-production.
Optimiser la synchronisation labiale
Décalage labial — le problème le plus fréquent.
Trois conseils :
1. Un seul locuteur par segment
Déjà dit, mais ça vaut la répétition. Plusieurs locuteurs simultanés = synchronisation instable.
2. Tours de parole explicites
Si le multi-voix est indispensable :
« The woman speaks first, then pauses. The man nods and replies. »
3. Ajouter « No subtitles. »
Détail souvent ignoré : Veo 3 peut superposer des sous-titres qui masquent la bouche. « No subtitles. » désactive cette fonction.
Différences chinois / anglais
Réalité peu réjouissante : le dialogue chinois est nettement inférieur à l’anglais.
Une vingtaine de prompts chinois testés : moins de 30 % de réussite. Problèmes fréquents :
- Répliques perdues : trois phrases écrites, une seule générée
- Confusion des locuteurs : A parle, la bouche de B bouge
- Accent artificiel : mandarin robotique
En anglais, le même scénario dépasse 70 %.
Contournement : dialogue principal en anglais, description de scène en chinois.
Exemple :
« 一个穿红色外套的女人走进咖啡馆,微笑着对服务员说:‘One cappuccino, please.’ » (scène en chinois, réplique en anglais)
Pratique à lire pour vous, sans sacrifier la qualité du dialogue.
Effets sonores et musique : une expérience immersive
Conception en couches des effets
Plus n’est pas mieux. Trop de sons = chaos.
Mon approche : trois couches, hiérarchie claire.
Premier plan (Foreground) — effets d’action principaux
Focus de l’attention : porte qui s’ouvre, verre qui se brise, pas — clairs et nets.
Plan intermédiaire (Midground) — ambiance secondaire
Sans voler la vedette au premier plan, mais ajoute du réalisme : machine à espresso, murmures de clients.
Arrière-plan (Background) — musique d’atmosphère
Son de fond qui pose l’ambiance : jazz doux, trafic lointain.
Exemple complet (café) :
Audio: espresso machine hissing (foreground), soft jazz music (background),
customers chatting quietly (midground). The barista says: "One cappuccino coming right up!"
Les parenthèses pour les couches aident Veo 3. Sans elles, la musique peut couvrir le dialogue.
Contrôler l’émotion de la musique de fond
Souvent négligée, pourtant cruciale.
Types de musique explicites :
- jazz
- classical (classique)
- electronic (électronique)
- ambient (ambient)
- upbeat (entraînant)
Modificateurs d’émotion :
- tense (tendu)
- upbeat (joyeux)
- melancholic (mélancolique)
- mysterious (mystérieux)
Exemples :
- « A soft, tense melody plays » (mélodie douce mais tendue)
- « Upbeat festival music with steady drums » (musique de fête entraînante, batterie régulière)
Le tempo compte aussi :
- slow tempo → scènes tristes, souvenirs
- fast tempo → action, poursuite
Éviter les conflits audio
Mon plus gros piège au départ.
Dans un clip de 5 secondes : pluie, tonnerre, pas, trafic, dialogue, musique — six éléments.
Résultat : bouillie sonore, rien n’est audible.
Leçon apprise : maximum 3-4 couches par segment, hiérarchie explicite.
Modificateurs de volume pour la priorité :
- loud (fort) → effet principal premier plan
- soft (doux) → musique de fond
- faint (faible) → ambiance lointaine
- dominating (dominant) → effet central
Exemple :
« Loud thunder crashes (dominating). Rain patters softly on the roof (background). A car engine starts faintly in the distance. »
Veo 3 sait : tonnerre en vedette, pluie en fond, moteur en touche.
Dépannage : 5 problèmes audio courants
Problème 1 : vidéo sans son
Le plus fréquent — environ 85 % des « vidéos muettes » viennent de ces trois causes.
Cause 1 : audio non spécifié dans le prompt
Vérifiez la présence de « Audio: », « says », dialogues entre guillemets. Sinon, Veo 3 génère en muet par défaut.
Solutions :
- Phrase dédiée : « Audio includes… »
- Dialogue entre guillemets : « The man says, ‘Hello.’ »
- En dernier recours : « Please generate this with clear speech. »
Cause 2 : mauvais mode qualité
Dans Flow : Preview (aperçu) et Highest Quality. L’aperçu ne génère pas l’audio.
Solution :
Flow → icône paramètres → « Highest Quality »
Cause 3 : description audio noyée
300 mots sur l’image, « with dialogue » en fin de prompt — Veo 3 ignore souvent l’audio.
Solution :
Placez les consignes audio au début ou dans la première moitié du prompt.
Problème 2 : dialogue et labial désynchronisés
Bouche qui flotte, voix en avance — surtout en multi-voix.
Cause : l’IA se perd avec plusieurs locuteurs simultanés.
Solutions :
- Découper : un locuteur par clip de 8 s, montage ensuite
- Raccourcir : une phrase en moins de 5 secondes
- Tours de parole : « The woman speaks first, pauses, then the man responds. »
En pratique : 80 % solo, 40 % multi-voix. Si la synchro labiale est critique, ne forcez pas le multi-voix direct.
Problème 3 : qualité audio médiocre ou artificielle
Voix « flottante », robotique.
Cause : prompt trop vague, sans caractéristiques vocales.
« A man speaks » — grave ? aigu ? rauque ? Sans info, Veo 3 produit une « voix d’homme moyenne ».
Solutions :
-
Caractéristiques vocales
- clear (claire)
- raspy (rauque)
- sharp (aiguë)
- deep (grave)
-
Réverbération de l’environnement
- indoor reverb (intérieur)
- outdoor, open space (extérieur)
- echoing space (espace réverbérant)
-
Accent et débit (dialogues anglais)
- British accent
- slow, deliberate pace
Exemple complet :
« A man with a deep, raspy voice speaks slowly in an indoor space: ‘Welcome home.’ »
Problème 4 : effets sonores et image incohérents
Parquet visuellement, pas qui sonnent comme de la pierre. Porte qui grince une seconde avant l’image.
Cause : description audio découplée de la scène visuelle.
Solution :
Décrire image et audio dans la même phrase, avec des mots de causalité.
❌ Descriptions séparées :
« A door opens. There is a creaking sound. »
✅ Description liée :
« As the door creaks open, a gust of wind rushes in. »
Mots de liaison :
- as (quand)
- when (lorsque)
- while (pendant que)
- making (produisant)
Exemple :
« She walks across the wooden floor, her heels clicking sharply with each step. »
Problème 5 : musique de fond couvrant dialogue ou effets
Dialogue soigneusement conçu, noyé sous la musique.
Cause : hiérarchie et volumes non précisés.
Solution :
Modificateurs de volume pour identifier le protagoniste sonore.
❌ Sans hiérarchie :
« Background music plays. The woman says, ‘Hello.’ »
✅ Hiérarchie claire :
« Soft background music plays quietly. The woman’s voice cuts through clearly: ‘Hello.’ »
Mots-clés :
- soft background music
- loud foreground dialogue
- voice cuts through
- music fades into background
Autre astuce : si le dialogue compte, supprimez la musique. Simple, efficace.
Techniques avancées : augmenter le taux de réussite
Utiliser un générateur de prompts Veo 3
Les prompts manuscrits oublient des détails. Solution : un générateur.
Deux outils gratuits recommandés :
-
prompt-helper.com/veo-3-prompt-generator
Sans inscription ; saisissez la scène, obtenez un prompt complet avec consignes audio. -
Générateur officiel Google Veo 3.1
Intégré à l’éditeur Flow ; suggère des éléments audio selon votre scène.
Pour les scènes complexes, je pars du générateur puis ajuste manuellement. Gain de temps notable.
Stratégie de maîtrise des coûts
Tarification Veo 3 : 0,75 $/seconde.
8 secondes = 6 $, une minute = 45 $. Cinq ou six essais, et la facture grimpe vite.
Astuces :
1. Tester en basse qualité d’abord
Le mode « Draft » dans Flow est rapide et moins cher, sans audio.
Idéal pour valider la composition, puis Highest Quality pour la version avec son.
2. Raccourcir la durée
Ne partez pas sur 60 secondes. Clips test de 5-8 secondes ; une fois l’audio satisfaisant, prolongez.
3. Exploiter « Extend »
Veo 3.1 peut prolonger une vidéo existante, moins cher qu’une regénération complète. Extend supporte désormais la continuité audio.
Ajustements post-production dans Flow
Veo 3.1 et Flow sont étroitement intégrés ; certains problèmes audio se corrigent après coup.
Ajustements possibles :
- Balance des volumes : musique trop forte → outil audio Flow
- Assemblage de segments : plusieurs clips solo → dialogue complet, plus fiable que le multi-voix direct
- Remplacement audio : conserver l’image, remplacer la piste (contre l’esprit du « natif », mais ça sauve des situations)
Extend est particulièrement utile :
Générez 8 secondes avec audio, Extend jusqu’à 15 s — l’audio se prolonge naturellement. Taux de réussite bien supérieur à une regénération directe de 15 s.
Les outils audio de Flow restent basiques. Pour une post-production professionnelle, exportez vers Premiere ou Final Cut.
Conclusion
Trois principes essentiels :
Spécifiez l’audio explicitement — Veo 3 ne devine pas ; dites-lui quels sons vous voulez.
Conception en couches — dialogues, effets, musique : hiérarchie claire, pas d’empilement.
Phrases courtes — dialogues en moins de 8 secondes, un locuteur à la fois.
La génération audio Veo 3 demande de la pratique. J’ai gaspillé une vingtaine de vidéos test avant de maîtriser ces règles. Une fois acquis, l’efficacité de création explose — 4 heures de doublage traditionnel en 3 minutes.
Le support chinois de Veo 3.1 reste perfectible, la synchro multi-voix aussi — mais c’est déjà une avancée majeure dans la génération vidéo. Google itère rapidement ; ces limites devraient s’améliorer l’an prochain.
Passez à l’action :
- Ouvrez Veo 3, mode Highest Quality
- Copiez un modèle de ce guide, adaptez à votre scène
- Générez votre première vidéo IA avec son
En cas de blocage, consultez la section dépannage. La génération audio est une compétence — pas de la magie noire. Quelques essais suffisent.
FAQ
Pourquoi la vidéo générée par Veo 3 n'a pas de son ?
1) Audio non spécifié dans le prompt :
• Inclure Audio:, says, dialogues entre guillemets, etc.
2) Mauvais mode qualité :
• Choisir Highest Quality
• Le mode aperçu ne génère pas l'audio
3) Instructions audio noyées :
• Placer les consignes audio dans la première moitié du prompt
Comment faire parler un personnage ?
Exemple : 'The woman smiles and says, "Welcome to Veo 3."'
Points d'attention :
• Dialogues courts, moins de 8 secondes
• Ajouter des modificateurs de ton (angrily, softly, excitedly) pour l'émotion
Que faire si le dialogue et la synchronisation labiale ne correspondent pas ?
1) Découper en segments : un seul locuteur par clip de 8 secondes
2) Raccourcir le dialogue : une phrase en moins de 5 secondes
3) Décrire explicitement les tours de parole
Taux de réussite :
• Solo : 80 %
• Multi-voix : 40 % seulement
Comment ajouter des effets sonores et une musique de fond ?
• SFX pour les effets
• Ambient pour les sons d'ambiance
Trois couches :
• Premier plan (effets d'action principaux)
• Plan intermédiaire (ambiance secondaire)
• Arrière-plan (musique d'atmosphère)
Astuces :
• Indiquer les couches entre parenthèses
• Modificateurs de volume (loud, soft, faint) pour la hiérarchie
• Maximum 3-4 couches audio par segment
Pourquoi le dialogue en chinois est-il moins bon qu'en anglais ?
• Répliques manquantes
• Confusion sur qui parle
• Accent artificiel
Prompts anglais : plus de 70 % de réussite.
Contournement : dialogue principal en anglais, description de scène en chinois
Exemple : '一个穿红色外套的女人走进咖啡馆,微笑着对服务员说:"One cappuccino, please."'
Comment maîtriser le coût audio ?
1) Tester la composition en mode Draft, puis Highest Quality pour l'audio
2) Raccourcir la durée : clips test de 5-8 secondes
3) Utiliser Extend pour prolonger une vidéo existante, moins cher qu'une regénération
Tarif Veo 3 : 0,75 $/s, soit 6 $ pour 8 secondes.
13 min de lecture · Publié le: 7 déc. 2025 · Mis à jour le: 27 juil. 2026
Guide Veo3
Si vous arrivez depuis la recherche, le plus rapide est de passer à l’article précédent ou suivant de cette série.
Précédent
Contrôle caméra Veo 3 : 7 mouvements pour un rendu cinématographique
Maîtrisez dolly shot, tracking shot et 5 autres mouvements de caméra pour donner instantanément un look cinéma à vos vidéos Veo 3. Modèles de prompts prêts à l'emploi et guide anti-pièges pour débuter en vidéo IA.
Partie 3 sur 9
Suivant
Cohérence des personnages Veo 3 : guide Scenebuilder pour des vidéos multi-plans
Apprenez à résoudre les incohérences d'apparence entre les plans avec Scenebuilder de Veo 3 : étapes complètes, modèles de prompts et astuces pratiques pour garder le même personnage d'un plan à l'autre.
Partie 5 sur 9



Commentaires
Connectez-vous avec GitHub pour laisser un commentaire