가입하면 프리미엄 플랜 할인할인 받기

블로그/tutorials·2026년 9월 10일·4분·eroq 팀 작성

영상에 AI 보이스오버 넣는 법, 대본부터 편집까지

대본을 쓰고, 표현력 있는 보이스로 렌더하고, 클립에 타이밍을 맞춘 뒤 eroq 패널로 Premiere 편집 아래에 까는 실전 워크플로.


소리 없는 AI 클립은 배경화면이에요. 같은 클립에 30초짜리 내레이션을 입히면 누군가 끝까지 보는 콘텐츠가 돼요. 보이스오버는 전체 파이프라인에서 가장 저렴한 업그레이드예요. 100단어짜리 대본은 몇 크레딧이면 되지만, 그 밑에 깔리는 영상에는 100크레딧 이상이 들거든요.

단계로 들어가기 전에 분명히 해 둘 게 하나 있어요. 나머지 모든 것을 좌우하는 부분이거든요. 이건 내레이션이지 립싱크가 아니에요. 여기서는 어떤 것도 오디오에 입 모양을 맞추지 않아요. 다큐멘터리나 얼굴 없는 채널처럼, 영상 위에 흐르는 별도의 보이스 트랙을 만드는 거예요. 그걸 전제로 쓰면 아주 잘 작동해요. 말하는 입을 기대하면 실망하게 될 거예요.

1단계: 고쳐 쓰기 쉬운 곳에서 대본 쓰기

대본은 보이스 입력창이 아니라 텍스트 스튜디오에서 쓰세요. 이유는 두 가지예요. 글솜씨가 좋은 모델을 쓸 수 있고, 매번 오디오를 다시 렌더하지 않고도 다듬을 수 있는 스레드가 생기거든요.

모드는 의도를 갖고 고르세요. 장면은 몰입감 있는 산문을 써 줘서 영상 위 내레이션에 알맞아요. 메시지는 문자 메시지처럼 짧은 대사를 써 줘서 캐릭터의 대사나 힘 있는 광고 문구에 알맞아요. 생성 비용은 모델에 따라 1 또는 3 크레딧이라, 영상에 비하면 초안 작업은 사실상 무료예요.

글솜씨보다 더 중요한 규칙이 두 가지 있어요.

  • 클립보다 짧게 쓰세요. 샷의 앞뒤에 남는 침묵은 편집에 주는 선물이에요. 모든 프레임을 꽉 채운 보이스 트랙은 숨 쉴 곳이 없어요.
  • 소리 내어 말할 법한 문장으로 쓰세요. 읽다가 내가 더듬으면 엔진도 더듬어요.

2단계: 보이스 고르기

보이스 스튜디오를 여세요. 엄선된 기본 보이스에는 따뜻하고 친밀한 여성 보이스 Aria와 낮고 차분한 남성 보이스 Orion이 있고, 둘 다 13개 언어를 지원해요. 그 밖의 카탈로그도 함께 있어요. 이름, 카테고리, 언어로 검색하고, 하나로 정하기 전에 여러 보이스를 들어 보세요.

기본 목록에 없는 특정 목소리가 필요하다면 직접 가진 오디오로 복제하세요. 쓸 만한 샘플의 조건은 음성 복제 도구 페이지에 있어요. 복제한 보이스는 스튜디오 어디서나 기본 보이스와 똑같이 작동해요. 저장한 캐릭터에도 기본 보이스나 복제 보이스를 연결할 수 있어서, 어떤 보이스를 썼는지 기억하지 않아도 시리즈 내내 같은 내레이터를 유지할 수 있어요.

3단계: 렌더하기

모델은 두 가지이고, 기본 보이스와 복제 보이스는 양쪽에서 똑같이 쓸 수 있어요.

  • Voice One: 표현력이 뛰어난 플래그십 모델로, 100자당 3 크레딧이고 MP3로 출력돼요. 시청자가 두 번 이상 듣게 될 모든 것에 쓰세요.
  • Voice Turbo: 더 빠르고, 100자당 2 크레딧이에요. 초안, 타이밍 테스트, 예산이 제약인 긴 분량에 쓰세요.

두 모델 모두 속도와 표현력 컨트롤이 있어요. 대사가 샷보다 3초 길 때 손대야 할 건 속도예요. 표현력은 양쪽 방향으로 테스트해 볼 만해요. 내레이션은 대개 생각보다 낮게, 캐릭터 대사는 대개 생각보다 높게 잡아야 하거든요.

모든 렌더는 다른 결과물처럼 라이브러리에 저장되니까, 마음에 들었던 테이크로 언제든 돌아올 수 있어요.

4단계: 문장 부호가 곧 연출이에요

별도의 감정 파라미터는 없어요. 낭독은 텍스트 자체, 특히 문장 부호로 결정돼요. 즉, 대본이 곧 연출이에요. 실제로 얻을 수 있는 효과를 있는 그대로 정리하면 이래요.

  • 마침표는 생각을 끝내고 음높이를 떨어뜨려요.
  • 쉼표는 멈춤이 아니라 짧게 들어 올리는 효과예요.
  • 대시는 — 바로 이것처럼 — 쉼표보다 박자를 더 오래 붙잡아요.
  • 말줄임표는 끝을 흐리며 부드럽게 맺어요.
  • 물음표는 문단 중간에서도 끝을 올려요.
  • 문단 나누기는 요청할 수 있는 가장 긴 쉼이에요.

지면이 아니라 낭독을 위해 쓴 대본은 이래요.

그는 열쇠를 탁자 위에 두고 갔다. 쪽지도 없이 — 아무것도.

나는 식어 버린 커피를 든 채, 이 중 어느 부분에 내가 동의했던 건지 따져 보며, 한참 동안 그 자리에 서 있었다.

그리고 가장 이상한 건? 문이 여전히 잠겨 있지 않았다는 거다.

소리 내어 읽어 보면 어디서 숨을 쉬는지 들려요. 그게 바로 테스트예요. 더 긴 쉼을 원하면 문단을 나누고, 대사가 밋밋하게 떨어진다면 대개 쉼표를 쓴 자리에 대시를 넣으면 해결돼요.

문장 부호가 못 하는 일은 감정이 없는 문장에 감정을 덧붙이는 거예요. 감정은 단어 안에 써 넣으세요.

5단계: 클립에 타이밍 맞추기

편집 프로그램을 연 다음이 아니라, 열기 전에 하세요.

  1. 스톱워치를 켜고 대본을 소리 내어 읽으세요. 그 시간이면 계획을 세우기에 충분히 정확해요.
  2. 거기에 맞춰 클립 길이를 고르세요. 엔진은 모델에 따라 3초부터 최대 30초까지 렌더하고, 플랜에 따라 최대 길이가 10초, 15초, 20초, 30초로 제한돼요.
  3. 먼저 Turbo로 보이스를 렌더해서 클립과 맞춰 들어 보세요.
  4. 길다면 속도를 올리기 전에 단어를 줄이세요. 살짝 올리는 정도를 넘어서면 빨리 감은 소리처럼 들리기 시작해요.
  5. 단어가 확정되면 최종본을 플래그십 보이스로 다시 렌더하세요.

시퀀스라면 영화 전체가 아니라 샷 단위로 작업하세요. 클립 여섯 개 위에 긴 내레이션 트랙 하나를 깔면 편집을 바꿀 때마다 전부 다시 렌더해야 해요. 짧은 대사 여섯 개라면 수정 한 번에 렌더 한 번이면 돼요. 얼굴 없는 유튜브 워크플로가 많은 양을 소화하면서도 관리가 가능한 것도 이 방식 덕분이에요.

6단계: 편집 아래에 깔기

MP3를 다운로드해서 쓰는 편집 프로그램에 넣으세요. Premiere Pro나 After Effects라면 eroq 패널 덕분에 왔다 갔다 할 필요가 없어요. 패널 안에서 동영상, 이미지, 음성을 생성하면 렌더가 열려 있는 프로젝트로 바로 들어오고, 파일은 문서(Documents) 폴더 아래에 저장돼요. 대사 하나를 생성하고, 타임라인에 놓고, 조정하고, 다음 대사를 생성하는 과정을 편집 화면을 떠나지 않고 할 수 있어요.

그다음은 사람 손으로 믹싱하세요. 보이스를 맨 위에 두고, 나머지는 모두 그 아래로 덕킹하고, 마지막 단어는 마지막 프레임 전에 끝나야 해요. 사운드를 자체 렌더하는 엔진으로 만든 샷이라 오디오가 들어 있다면, 음소거하지 말고 내레이션 아래에 베드로 깔아 두세요. 목소리 아래 흐르는 앰비언스가 ‘잘 만든’ 소리의 대부분이에요.

스크립트로 자동화하고 싶다면 음성 문서에서 같은 내용을 API 관점으로 다루고, 이 작업의 영상 쪽 절반은 동영상 스튜디오에서 해요.

자주 묻는 질문

eroq로 보이스오버에 맞춰 캐릭터 립싱크를 할 수 있나요?

아니요. 립싱크 기능은 없어요. 보이스 트랙은 영상과 별개로 생성되기 때문에 내레이션, 광고, 얼굴 없는 콘텐츠에 딱 맞아요. 이 전제를 두고 쓰고 편집하세요.

보이스오버 비용은 얼마인가요?

플래그십 보이스는 100자당 3 크레딧, 더 빠른 보이스는 100자당 2 크레딧이고 MP3로 출력돼요. 600자짜리 대본이면 대략 18 또는 12 크레딧으로, 함께 나갈 클립에 비하면 작은 금액이에요.

시리즈 전체에 같은 내레이터를 쓸 수 있나요?

네. 기본 보이스를 고르거나 하나를 복제한 다음, 저장한 캐릭터에 연결하면 매번 같은 보이스가 선택돼요. 복제 보이스는 기본 보이스를 쓸 수 있는 곳이라면 어디서나 쓸 수 있어요.

쓰고, 말하고, 자르세요. 보이스 스튜디오를 열어 보세요. 새 계정은 무료 50 크레딧으로 시작해요.

태그voice-overtext-to-speechai-videopremiere-protutorial

이 글에 나온 모델로 직접 만들어 보세요 — 무료 크레딧 50개로 시작하거나, 모든 엔진과 가격도 살펴보세요.