테마 전환

Veo 3 오디오 생성 방법: AI 영상에 음성·효과음·음악 넣기

Easton editorial illustration: local model vault

Veo 3는 영상에 소리를 자동으로 넣어 주지 않습니다. 프롬프트에 "A woman says: 'Hello'"라고 써도 품질 모드를 제대로 선택하지 않았거나 오디오 설명이 충분히 명확하지 않으면 결과물은 무음 영상이 됩니다.

Google이 2025년 I/O에서 Veo 3를 발표했을 때 내세운 주요 기능 중 하나가 바로 네이티브 오디오 지원이었습니다. 대화, 효과음, 배경음악을 화면과 함께 동기화해 생성할 수 있습니다. 하지만 기본으로 켜지는 기능은 아닙니다. 누가 무슨 말을 하는지, 장면에서 어떤 소리가 나야 하는지, 여러 사람이 대화할 때 누가 먼저 말하는지를 프롬프트에 분명히 써야 합니다. 1인 대화의 립싱크 성공률은 약 80%지만 다인 대화는 40% 아래로 떨어지고, 중국어 대화는 30%에 불과합니다.

여기서는 Veo 3 오디오 생성의 작동 방식을 살펴보고 대화, 효과음, 배경음악용 프롬프트 템플릿과 자주 겪는 문제 5가지를 해결하는 방법을 정리합니다.

Veo 3 오디오 생성의 변화: 무음 영상에서 벗어나기

네이티브 오디오 생성이란

기존 AI 영상 생성 과정은 이렇습니다. 먼저 영상을 만든 다음 성우를 구하고, 녹음하고, 효과음을 만들고, 믹싱까지 직접 해야 했습니다. Promise Studios 팀의 계산에 따르면 이 전체 과정에는 평균 4시간이 걸립니다.

Veo 3는 이 과정을 3분으로 줄였습니다.

Veo 3는 이른바 “dual-stream 아키텍처”를 사용합니다. 기술적인 표현처럼 들리지만, 영상과 오디오를 동시에 생성해 자동으로 맞춘다는 뜻입니다. 프롬프트 하나를 입력하면 AI가 화면과 소리를 함께 만들기 때문에 캐릭터가 말할 때 입 모양과 음성이 자연스럽게 동기화되고, 환경음도 화면에 맞게 생성됩니다. 비가 오면 빗소리가 나고, 나무 바닥을 걸으면 발소리가 들립니다.

다만 중요한 점이 있습니다. Veo 3의 오디오 기능은 세 가지로 나뉘며, 이를 구분해야 제대로 활용할 수 있습니다.

1. 대화(Dialogue)
캐릭터나 내레이션이 말하는 내용입니다. 어조, 억양, 감정을 조절할 수 있습니다.

2. 효과음(Sound Effects)
장면에서 발생하는 구체적인 소리입니다. 전화벨, 물이 튀는 소리, 문이 삐걱거리며 열리는 소리 등이 여기에 해당합니다.

3. 환경음(Ambient Noise)
장면을 사실적으로 만드는 배경 소리입니다. 도시의 차량 소음, 해안에 부딪히는 파도, 사무실 에어컨의 웅웅거리는 소리 등이 있습니다.

Veo 3.1의 오디오 개선 사항(2025년 10월)

2025년 10월 14일, Google은 오디오 품질을 크게 개선한 Veo 3.1을 다시 발표했습니다.

직접 비교해 보니 Veo 3에서 생성한 대화는 간혹 음성과 입 모양이 반 박자 어긋나는 문제가 있었습니다. Veo 3.1에서는 이 문제가 거의 해결됐고, 이제는 다인 대화도 지원합니다. 두 캐릭터가 차례로 말해도 대사가 뒤섞이지 않습니다.

또 하나 실용적인 업데이트가 있습니다. 이전에는 “텍스트로 영상 만들기”에서만 오디오를 넣을 수 있었지만, 이제는 “재료로 영상 만들기”(이미지를 업로드해 영상 생성)와 “프레임 확장”(영상 길이 연장) 같은 기능도 오디오를 지원합니다.

다만 Veo 3.1이 생성한 오디오는 “first draft”(초안)에 더 가깝습니다. 커뮤니티 피드백에 따르면 오디오 자연스러움은 실제 녹음의 92% 수준이지만, 전문 프로젝트라면 후반 작업에서 다듬어야 합니다. 현재 영상 1초에 $0.75이므로 결과물을 바로 완성본으로 쓰기에는 위험 부담이 있습니다.

오디오 프롬프트의 핵심 원칙: 명확해야 작동합니다

무음 영상이 생성되는 이유

처음 Veo 3를 썼을 때 영상의 약 70%에서 소리가 나지 않았습니다. AI가 고장 난 것이 아니라 프롬프트가 너무 모호했기 때문입니다.

Veo 3에는 한 가지 설계 원칙이 있습니다. 사용자가 요청하지 않으면 오디오를 알아서 추가하지 않습니다. 아무 말도 하지 않으면 무음 영상을 원한다고 간주합니다.

예를 들어 "A woman walking in the rain."이라고 쓰면 Veo 3는 빗속을 걷는 여성의 화면을 그대로 생성합니다. 하지만 빗소리도, 발소리도, 그 밖의 어떤 소리도 없습니다.

"A woman walking in the rain. Audio: rain pattering on pavement, footsteps splashing through puddles."로 바꿔야 합니다. 그래야 빗소리와 물웅덩이를 밟는 발소리가 필요하다는 것을 알 수 있습니다.

한 가지 함정이 더 있습니다. Flow에서 Veo 3를 사용한다면 품질 모드를 “Highest Quality”로 설정해야 합니다. 기본 미리보기 모드에서는 오디오가 생성되지 않습니다. 저도 처음에는 이 설정 때문에 열 번 넘게 시도하고도 소리가 나지 않았습니다.

세 가지 오디오 유형별 프롬프트 전략

이제 오디오 프롬프트 작성법을 살펴보겠습니다.

대화(Dialogue): 형식이 일정해야 결과가 좋습니다

공식은 간단합니다. 캐릭터 설명 + 동작 + 따옴표로 감싼 대화입니다.

❌ 잘못된 예:
"A woman says hello."(너무 모호해서 AI가 실제 대사를 알 수 없음)

✅ 올바른 예:
"The woman smiles and says, 'Welcome to Veo 3.'"

어조를 조절하려면 감정 수식어를 추가합니다.

  • angrily(화난 목소리로)
  • nervously(긴장한 목소리로)
  • softly(부드럽게)
  • excitedly(신이 나서)

전체 예:
"The man leans forward and says angrily, 'Where is my coffee?'"

효과음(Sound Effects): 동작 + 소리 설명

이 유형의 프롬프트는 소리의 세부 특징까지 구체적으로 써야 합니다.

❌ 모호한 예:
"a phone"(AI는 전화기에서 어떤 일이 일어나는지 알 수 없음)

✅ 구체적인 예:
"the sound of a phone ringing"
"water splashing in the background"
"soft house sounds, the creak of a closet door, and a ticking clock"

작은 요령이 하나 있습니다. as, when 같은 단어를 사용해 효과음을 화면의 동작과 연결합니다.
"As the door creaks open, a gust of wind rushes in."
이렇게 쓰면 효과음과 화면 사이의 인과관계가 분명해집니다.

환경음(Ambient Noise): 장면 + 배경 소리의 층위

환경음은 여러 층으로 설명해야 합니다. 그렇지 않으면 소리가 평면적으로 들립니다.

❌ 단조로운 예:
"city sounds"(너무 포괄적임)

✅ 층위가 있는 예:
"the sounds of city traffic and distant sirens"(가까운 차량 소리 + 먼 곳의 사이렌)
"waves crashing on the shore"(주요 효과음)
"the quiet hum of an office"(바탕 소음)

공간감을 살리는 오디오 설명법

조금 더 고급 방법이지만 실제로 매우 유용합니다.

사람은 소리의 방향과 거리를 느낄 수 있습니다. 가까운 소리는 선명하고 먼 소리는 흐릿하게 들립니다. Veo 3도 이를 이해할 수 있지만 프롬프트에 직접 알려 줘야 합니다.

다음 표현으로 공간 관계를 설명할 수 있습니다.

  • in the distance(먼 곳에서)
  • cuts through(뚫고 나오는, 주요 효과음을 나타냄)
  • somewhere above(위쪽 어딘가에서)
  • faintly(희미하게)
  • echoing(메아리치는)

전체 예(직접 테스트했을 때 결과가 좋았습니다):

Rain falls steadily onto wet pavement, pattering softly across rooftops and metal bins.
A single, low thunderclap rolls across the sky, echoing faintly between tall buildings.
A car passes faintly in the distance. A dog barks once.
A soft, tense melody plays from an old radio somewhere above.

여기에는 다음 요소가 있습니다.

  • 가까운 주요 효과음: 바닥에 떨어지는 빗소리
  • 중간 거리의 보조음: 멀리서 메아리치는 천둥
  • 먼 거리의 배경음: 지나가는 자동차와 한 번 짖는 개
  • 분위기음: 위층 어딘가의 라디오

이처럼 오디오를 여러 층으로 나누어 설명하면 Veo 3가 매우 정확하게 이해합니다.

대화 생성 실전: 캐릭터가 말하게 만들기

1인 대화 모범 사례

대화 생성은 Veo 3 오디오 기능 가운데 가장 다루기 어렵습니다. 기술적으로 어려워서가 아니라 지켜야 할 규칙이 많기 때문입니다.

첫 번째 원칙은 대화는 한 문장으로 짧게, 8초 안에 끝내는 것입니다.

캐릭터에게 긴 문단을 말하게 해 봤지만 대사가 빠지거나 입 모양이 엉키곤 했습니다. Veo 3의 긴 대화 동기화 능력이 아직 안정적이지 않기 때문입니다. 대화를 여러 장면으로 나누거나 한 문장 안에 끝내야 합니다.

두 번째 원칙은 감정 + 동작 + 언어를 함께 쓰는 것입니다.

❌ 평범한 예:
"He says, 'Did you hear that?'"

✅ 긴장감 있는 예:
"He bursts into wild laughter, head thrown back. Mid-laugh, he stops, eyes widening in terror, then whispers softly: 'Did you hear that?'"

차이가 보이나요? 두 번째 예는 크게 웃음 → 갑자기 멈춤 → 공포 → 속삭임이라는 감정 변화의 과정까지 적었습니다. Veo 3는 이러한 감정 전환도 생성할 수 있어 훨씬 사실적인 결과를 만듭니다.

세 번째 원칙은 캐릭터의 일관성이 매우 중요하다는 것입니다.

여러 장면을 만들려면 매번 같은 캐릭터 설명을 사용해야 합니다. 예를 들어 "a woman in a red coat with short black hair"라는 설명은 모든 프롬프트에서 완전히 같아야 합니다. 그렇지 않으면 AI가 다른 캐릭터를 만들고 목소리도 달라질 수 있습니다.

여러 캐릭터가 대화할 때의 요령

두 사람이 동시에 말하는 장면은 Veo 3 오디오 생성에서 가장 까다로운 경우입니다.

다음처럼 대화 스크립트를 직접 써 봤습니다.

Man: "What are you doing?"
Woman: "None of your business."

결과는 처참했습니다. 한 사람의 목소리만 나오거나 두 사람의 대화가 화면과 맞지 않았습니다.

올바른 방법은 대화 스크립트를 쓰지 말고 장면의 흐름을 쓰는 것입니다.

✅ 효과적인 예:
"Inside a cluttered garage, two teenage friends argue over a broken time machine. One leans over the table, frustrated and loud. The other avoids eye contact, mumbling and fiddling with wires. Rain hits the roof, and the lights flicker."

이 방식의 핵심은 AI에 “두 사람이 다투고 있다”는 상황을 이해시키는 것이지, “A는 이 대사를 하고 B는 저 대사를 한다”고 지시하는 것이 아닙니다. Veo 3가 누가 언제 무엇을 말할지 스스로 결정하게 합니다.

다만 솔직히 말하면 다인 대화의 성공률은 여전히 1인 대화보다 낮습니다. 복잡한 대화를 만들려면 각 장면에서 한 사람만 말하게 한 뒤 후반 작업으로 이어 붙이는 편이 좋습니다.

립싱크 최적화

입 모양이 맞지 않는 것은 대화 생성에서 가장 흔한 문제입니다.

세 가지 방법을 권합니다.

1. 장면마다 한 캐릭터만 말하게 합니다
앞에서도 언급했지만 다시 강조할 만합니다. 여러 화자가 동시에 등장하면 동기화가 쉽게 흐트러집니다.

2. 말하는 순서를 명확히 설명합니다
여러 사람이 반드시 대화해야 한다면 누가 먼저 말하고 누가 나중에 말하는지 분명히 씁니다.
"The woman speaks first, then pauses. The man nods and replies."

3. “No subtitles.”를 추가합니다
잘 알려지지 않은 세부 사항입니다. Veo 3는 때때로 화면에 자막을 자동 생성해 캐릭터의 입을 가립니다. "No subtitles."를 추가하면 이 기능을 끌 수 있습니다.

중국어와 영어 대화의 차이

불편한 현실이 하나 있습니다. 중국어 대화 결과는 영어보다 훨씬 좋지 않습니다.

중국어 대화 프롬프트를 스무 개 넘게 테스트했지만 성공률은 30%가 되지 않았습니다. 흔한 문제는 다음과 같습니다.

  • 대사 누락: 세 문장을 썼는데 한 문장만 생성됨
  • 화자 혼동: A의 대사인데 B의 입이 움직임
  • 어색한 억양: 표준 중국어가 로봇처럼 들림

영어는 훨씬 낫습니다. 같은 장면에서도 영어 프롬프트의 성공률은 70% 이상에 달합니다.

우회 방법은 핵심 대화는 영어로 쓰고 장면 설명은 중국어로 쓰는 것입니다.

예:
"一个穿红色外套的女人走进咖啡馆,微笑着对服务员说:'One cappuccino, please.'"(장면은 중국어, 대화는 영어)

이렇게 하면 프롬프트 내용을 쉽게 이해하면서도 대화 품질을 유지할 수 있습니다.

효과음과 음악: 몰입감 있는 경험 만들기

효과음의 레이어 설계

효과음은 많을수록 좋은 것이 아닙니다. 소리를 너무 많이 쌓으면 전체가 복잡하게 들립니다.

제 경험상 세 개의 레이어로 나누고 우선순위를 분명히 하는 것이 좋습니다.

전경(Foreground) — 핵심 동작 효과음
시청자의 관심이 집중되는 소리입니다. 문이 열리는 소리, 컵이 깨지는 소리, 발소리 등은 선명하고 크게 들려야 합니다.

중경(Midground) — 보조 환경음
주요 효과음을 방해하지 않으면서 사실감을 높입니다. 카페에서 에스프레소 머신이 윙윙거리는 소리나 손님들이 작은 목소리로 대화하는 소리가 여기에 해당합니다.

배경(Background) — 분위기 음악
장면의 감정을 만드는 바탕 소리입니다. 잔잔한 재즈나 멀리서 들리는 차량 소음 등이 있습니다.

전체 예(카페 장면):

Audio: espresso machine hissing (foreground), soft jazz music (background),
customers chatting quietly (midground). The barista says: "One cappuccino coming right up!"

괄호로 레이어를 표시하면 Veo 3가 더 정확히 이해합니다. 표시하지 않으면 배경음악을 너무 크게 만들어 대화를 덮기도 합니다.

배경음악의 감정 조절

배경음악은 놓치기 쉽지만 매우 중요한 요소입니다.

음악 장르를 명확히 씁니다.

  • jazz(재즈)
  • classical(클래식)
  • electronic(일렉트로닉)
  • ambient(앰비언트 음악)
  • upbeat(경쾌한 음악)

감정 수식어:

  • tense(긴장된)
  • upbeat(경쾌한)
  • melancholic(우울한)
  • mysterious(신비로운)

구체적인 예:

  • "A soft, tense melody plays"(부드럽지만 긴장감 있는 선율)
  • "Upbeat festival music with steady drums"(일정한 드럼 비트가 있는 경쾌한 축제 음악)

많이 알려지지 않은 세부 사항이 하나 있습니다. 음악의 tempo(템포)도 조절할 수 있습니다.

  • slow tempo(느린 템포) → 슬픔이나 회상 장면에 적합
  • fast tempo(빠른 템포) → 액션이나 추격 장면에 적합

오디오 충돌 피하기

직접 겪었던 가장 큰 문제입니다.

처음에는 효과음이 풍부할수록 사실적이라고 생각했습니다. 그래서 5초짜리 장면 하나에 빗소리, 천둥, 발소리, 차량 소음, 대화, 배경음악까지 총 여섯 가지 오디오 요소를 넣었습니다.

결과는 모든 소리가 뒤섞여 어느 하나도 제대로 들리지 않았습니다.

그 뒤로는 한 장면에 오디오 레이어를 최대 3~4개만 넣고 우선순위를 명확히 합니다.

음량 수식어로 우선순위를 표시합니다.

  • loud(큰 소리) → 전경의 주요 효과음
  • soft(부드러운 소리) → 배경음악
  • faint(희미한 소리) → 먼 거리의 환경음
  • dominating(지배적인 소리) → 핵심 효과음

예:
"Loud thunder crashes (dominating). Rain patters softly on the roof (background). A car engine starts faintly in the distance."

이렇게 하면 Veo 3는 천둥이 중심이고, 빗소리가 바탕을 이루며, 자동차 소리가 분위기를 더한다는 것을 알 수 있습니다.

문제 해결: 자주 발생하는 오디오 문제 5가지

문제 1: 생성한 영상에서 소리가 나지 않음

가장 흔한 문제입니다. “무음 영상”의 약 85%는 다음 세 가지 원인에서 발생합니다.

원인 1: 프롬프트에 오디오를 명확히 지정하지 않음

프롬프트에 "Audio:", "says", 따옴표로 감싼 대화 같은 키워드가 있는지 확인합니다. 없다면 Veo 3는 기본적으로 무음 영상을 생성합니다.

해결 방법:

  • 독립된 문장으로 오디오를 설명합니다. "Audio includes..."
  • 대화를 따옴표로 감쌉니다. "The man says, 'Hello.'"
  • 그래도 안 되면 "Please generate this with clear speech."를 추가합니다.

원인 2: 잘못된 품질 모드 선택

Flow에는 Preview(미리보기)와 Highest Quality(최고 품질)라는 두 가지 모드가 있습니다. 미리보기 모드에서는 오디오가 생성되지 않습니다.

해결 방법:
Flow 열기 → 설정 아이콘 클릭 → “Highest Quality” 선택

원인 3: 프롬프트에서 오디오 설명이 다른 내용에 묻힘

화면을 설명하는 문자를 300자 쓴 뒤 마지막에 "with dialogue" 한마디만 덧붙이면 Veo 3가 오디오 지시를 무시할 수 있습니다.

해결 방법:
오디오 지시를 앞당겨 프롬프트의 앞부분에 배치합니다.

문제 2: 대화와 입 모양이 맞지 않음

입 모양이 불안정하거나 목소리가 입 모양보다 반 박자 빠른 문제는 다인 대화에서 특히 자주 발생합니다.

근본 원인: AI가 여러 화자를 동시에 처리할 때 혼란이 생김

해결 방법:

  1. 장면 분할: 각 8초 장면에서는 한 사람만 말하게 하고 후반 작업에서 이어 붙입니다.
  2. 대화 단축: 한 문장을 5초 안에 끝냅니다.
  3. 말하는 순서 설명: "The woman speaks first, pauses, then the man responds."

직접 테스트한 결과, 1인 대화의 립싱크 성공률은 80%였지만 다인 대화는 40%에 불과했습니다. 립싱크가 중요하다면 억지로 한 장면에 넣지 않는 편이 좋습니다.

문제 3: 오디오 품질이 낮거나 부자연스러움

목소리가 붕 뜨고 기계적이며 로봇처럼 들리는 경우입니다.

원인: 프롬프트가 너무 모호하고 목소리의 특징을 설명하지 않음

예를 들어 "A man speaks"라고만 쓰면 AI는 남성의 목소리가 어떤지 알 수 없습니다. 낮고 굵은지, 날카로운지, 쉰 목소리인지 정보가 없으므로 평균적인 남성 목소리를 만들 수밖에 없습니다.

해결 방법:

  1. 목소리 특징 설명 추가

    • 선명한(clear)
    • 쉰 목소리의(raspy)
    • 날카로운(sharp)
    • 낮고 굵은(deep)
  2. 공간의 잔향 설명

    • 실내(indoor reverb)
    • 야외(outdoor, open space)
    • 울림이 있는 공간(echoing space)
  3. 억양과 말하는 속도 지정(영어 대화에 적용)

    • 영국식 억양(British accent)
    • 느리고 신중한 속도(slow, deliberate pace)

전체 예:
"A man with a deep, raspy voice speaks slowly in an indoor space: 'Welcome home.'"

문제 4: 효과음과 화면이 맞지 않음

캐릭터가 나무 바닥을 걷는데 돌바닥을 밟는 것처럼 들리거나 문이 열리기 1초 전에 소리가 나는 경우입니다.

원인: 효과음 설명과 시각적 장면이 분리됨

해결 방법:
한 문장 안에서 화면과 오디오를 함께 설명하고 인과관계를 나타내는 단어로 연결합니다.

❌ 분리된 설명:
"A door opens. There is a creaking sound."

✅ 연결된 설명:
"As the door creaks open, a gust of wind rushes in."

다음 단어로 인과관계를 만들 수 있습니다.

  • as(~할 때)
  • when(~할 때)
  • while(~하는 동안)
  • making(~하는 소리를 내며)

예:
"She walks across the wooden floor, her heels clicking sharply with each step."

문제 5: 배경음악이 대화나 효과음을 덮음

특히 성가신 문제입니다. 공들여 만든 대화가 배경음악에 완전히 묻힐 수 있습니다.

원인: 오디오 레이어와 음량 관계를 명확히 지정하지 않음

해결 방법:
음량 수식어를 사용해 무엇이 중심인지 분명히 표시합니다.

❌ 레이어가 없는 예:
"Background music plays. The woman says, 'Hello.'"

✅ 레이어가 명확한 예:
"Soft background music plays quietly. The woman's voice cuts through clearly: 'Hello.'"

핵심 수식어:

  • soft background music(부드러운 배경음악)
  • loud foreground dialogue(큰 전경 대화)
  • voice cuts through(목소리가 뚜렷하게 들림)
  • music fades into background(음악이 배경으로 잦아듦)

또 다른 방법은 대화가 중요하다면 배경음악을 아예 넣지 않는 것입니다. 단순하지만 효과적입니다.

고급 활용법: 오디오 생성 성공률 높이기

Veo 3 프롬프트 생성기 사용하기

프롬프트를 직접 쓰면 세부 사항을 빠뜨리기 쉽습니다. 프롬프트 생성기를 사용하면 수고를 줄일 수 있습니다.

무료 도구 두 가지를 권합니다.

  1. prompt-helper.com/veo-3-prompt-generator
    로그인 없이 장면 설명을 입력하면 오디오 지시가 포함된 완전한 프롬프트를 자동으로 생성합니다.

  2. Google 공식 Veo 3.1 프롬프트 생성기
    Flow 편집기에 통합되어 있으며 장면을 바탕으로 오디오 요소를 자동 제안합니다.

저는 복잡한 장면을 만들 때 대부분 생성기로 초안을 만든 뒤 세부 내용을 직접 조정합니다. 시간을 상당히 아낄 수 있습니다.

비용 관리 전략

Veo 3의 요금은 초당 $0.75입니다.

8초 영상은 $6이고 1분은 $45입니다. 다섯 번이나 여섯 번만 다시 시도해도 비용이 빠르게 늘어납니다.

비용을 줄이는 방법은 다음과 같습니다.

1. 먼저 낮은 품질 모드로 테스트합니다
Flow의 “Draft” 모드는 생성 속도가 빠르고 저렴하지만 오디오를 생성하지 않습니다.
먼저 화면 구도를 테스트하고, 확인한 뒤 Highest Quality로 오디오 버전을 렌더링할 때 적합합니다.

2. 영상 길이를 줄입니다
처음부터 60초 영상을 만들지 마세요. 먼저 5~8초 테스트 장면을 만들고 오디오 결과가 만족스러우면 길이를 늘립니다.

3. “Extend” 기능을 활용합니다
Veo 3.1의 Extend 기능은 기존 영상을 늘릴 수 있으며 새로 생성하는 것보다 저렴합니다. 이제 Extend에서도 오디오를 이어 갈 수 있습니다.

Flow 편집기에서 후반 조정하기

Veo 3.1은 Flow와 긴밀하게 통합되어 있어 일부 오디오 문제를 후반 작업에서 수정할 수 있습니다.

가능한 후반 조정:

  • 음량 균형: 배경음악이 너무 크면 Flow의 오디오 조절 도구로 음량을 낮출 수 있습니다.
  • 장면 연결: 여러 1인 대화 장면을 완전한 대화로 연결하면 다인 대화를 한 번에 생성하는 것보다 안정적입니다.
  • 오디오 교체: 화면은 유지하고 오디오 트랙만 교체할 수 있습니다. “네이티브 오디오”라는 취지와는 조금 어긋나지만 결과물을 살리는 데 유용합니다.

Flow의 “Extend” 기능은 특히 유용합니다.
오디오가 포함된 8초 영상을 만든 뒤 Extend로 15초까지 늘리면 오디오가 자연스럽게 이어집니다. 15초 영상을 새로 생성하는 것보다 성공률이 훨씬 높습니다.

솔직히 말하면 Flow의 오디오 편집 기능은 아직 기초적인 수준입니다. 전문적인 오디오 후반 작업이 필요하다면 Premiere나 Final Cut으로 내보내 세밀하게 다듬어야 합니다.

결론

내용이 많았지만 핵심은 세 문장입니다.

오디오를 명확히 지정하세요. Veo 3는 필요한 소리를 알아서 추측하지 않으므로 원하는 소리를 직접 알려 줘야 합니다.

레이어를 나눠 설계하세요. 대화, 효과음, 배경음악의 우선순위를 구분하고 너무 많이 쌓지 마세요.

짧은 문장을 사용하세요. 대화는 8초 이내로 제한하고 한 번에 한 사람만 말하게 합니다.

Veo 3 오디오 생성은 감을 잡을 때까지 여러 번 시도해야 합니다. 저도 이 원칙을 파악하기 전 테스트 영상 약 20개를 버렸습니다. 하지만 익숙해지면 영상 제작 효율을 몇 배 높일 수 있습니다. 기존 방식에서 4시간 걸리던 더빙 작업을 이제 3분 안에 끝낼 수 있습니다.

Veo 3.1의 중국어 지원은 아직 충분하지 않고 다인 대화 동기화도 개선할 여지가 있지만, 영상 생성 분야에서는 이미 큰 진전입니다. Google은 Veo 3를 빠르게 개선하고 있다고 밝혔으므로 내년에는 이러한 문제가 나아질 가능성이 있습니다.

지금 바로 시작해 보세요.

  1. Veo 3를 열고 Highest Quality 모드를 선택합니다.
  2. 이 글의 프롬프트 템플릿 하나를 복사해 자신의 장면에 맞게 수정합니다.
  3. 오디오가 포함된 첫 AI 영상을 생성합니다.

문제가 생기면 다섯 번째 장의 문제 해결 목록을 다시 확인하세요. 오디오 생성에는 요령이 필요하지만 결코 마법은 아닙니다. 몇 번 시도하면 감을 잡을 수 있습니다.

FAQ

Veo 3로 생성한 영상에서 소리가 나지 않는 이유는 무엇인가요?
흔한 원인은 세 가지입니다.

1) 프롬프트에 오디오를 명확히 지정하지 않음:
• Audio:, says, 따옴표로 감싼 대화 같은 키워드가 필요합니다.

2) 잘못된 품질 모드 선택:
• Highest Quality를 선택해야 합니다.
• 미리보기 모드에서는 오디오가 생성되지 않습니다.

3) 오디오 설명이 다른 내용에 묻힘:
• 오디오 지시문을 프롬프트 앞부분에 배치해야 합니다.
캐릭터가 실제로 말하게 하려면 어떻게 해야 하나요?
캐릭터 설명 + 동작 + 따옴표로 감싼 대화 형식을 사용합니다.

예: 'The woman smiles and says, "Welcome to Veo 3."'

주의 사항:
• 대화는 짧게, 8초 이내로 제한합니다.
• 어조 수식어(angrily, softly, excitedly)를 넣어 감정을 조절할 수 있습니다.
대화와 입 모양이 맞지 않으면 어떻게 해야 하나요?
해결 방법은 세 가지입니다.

1) 장면을 나누고 각 8초 장면에서는 한 사람만 말하게 합니다.

2) 대화를 줄여 한 문장을 5초 이내로 제한합니다.

3) 말하는 순서를 명확하게 설명합니다.

성공률 비교:
• 1인 대화 립싱크 성공률 80%
• 다인 대화는 40%
효과음과 배경음악은 어떻게 추가하나요?
표기 방법:
• 효과음은 SFX로 표시합니다.
• 환경음은 Ambient로 표시합니다.

세 단계로 설계합니다:
• 전경(핵심 동작 효과음)
• 중경(보조 환경음)
• 배경(분위기 음악)

팁:
• 괄호로 각 층을 표시합니다.
• 음량 수식어(loud, soft, faint)로 우선순위를 명확히 합니다.
• 한 장면에는 오디오를 최대 3~4개 층만 사용합니다.
중국어 대화가 영어보다 잘 생성되지 않는 이유는 무엇인가요?
중국어 대화의 성공률은 30% 미만이며, 흔한 문제는 다음과 같습니다.
• 대사 누락
• 화자 혼동
• 어색한 억양

영어 프롬프트는 성공률이 70% 이상일 수 있습니다.

우회 방법: 핵심 대화는 영어로 쓰고 장면 설명은 중국어로 작성합니다.

예: '一个穿红色外套的女人走进咖啡馆,微笑着对服务员说:"One cappuccino, please."'
오디오 생성 비용은 어떻게 줄이나요?
비용을 줄이는 방법은 세 가지입니다.

1) 먼저 Draft 모드로 화면 구도를 테스트하고, 확인한 뒤 Highest Quality로 오디오 버전을 렌더링합니다.

2) 영상 길이를 줄여 5~8초 테스트 장면부터 만듭니다.

3) Extend 기능으로 기존 영상을 늘립니다. 새로 생성하는 것보다 저렴합니다.

Veo 3 요금은 초당 $0.75이며, 8초 영상은 $6입니다.

3분 읽기 · 게시일: 2025년 12월 7일 · 수정일: 2026년 9월 4일

댓글

GitHub로 로그인하여 댓글을 남기세요

Easton BlogEaston Blog