가입하면 프리미엄 플랜 할인할인 받기

블로그/guides·2026년 9월 5일·5분·eroq 팀 작성

AI 성우 vs 사람 성우 섭외: 솔직한 비용 비교

AI 내레이션 1분의 실제 비용, 수정이 반영되는 속도, 그리고 여전히 사람 성우를 섭외하는 게 맞는 작업까지 정리했어요.


이런 비교 글은 보통 팔 물건이 있는 쪽에서 써요. 여기서는 계산 과정을 전부 보여 드리고, 지는 부분도 인정할게요. 합성 음성은 글자 수로, 사람은 프로젝트 단위로 가격이 매겨지는데, 두 단위가 워낙 다르게 움직여서 흥미로운 질문은 '어느 쪽이 더 싼가'가 아니라 '이 작업에서 어떤 실패를 감당할 수 있는가'예요.

내레이션 1분의 실제 비용

음성 모델은 초 단위가 아니라 글자 수 단위로 과금하니, 먼저 환산부터 해야 해요. 영어 기준으로 편안한 내레이션 속도는 분당 약 150단어이고, 영어 단어 하나에 공백을 더하면 약 6자예요. 그래서 말하는 1분은 대략 900자예요.

Voice One은 100자 블록이 새로 시작될 때마다 3 크레딧을 받아요. Voice Turbo는 2 크레딧이에요.

  • Voice One: 900 ÷ 100 = 9블록 × 3 = 분당 27 크레딧. 입문 팩 요율로 약 27센트, Creator 플랜 요율로 약 22센트예요.
  • Voice Turbo: 9블록 × 2 = 분당 18 크레딧. 약 18센트, Creator에서는 15센트예요.

이제 실제 결과물 규모로 늘려 볼게요.

  • 90초짜리 설명 영상 스크립트는 약 1,350자, 즉 14블록이라 Voice One으로 42 크레딧, 대략 34센트예요.
  • 30분짜리 내레이션은 약 27,000자라 Voice One으로 810 크레딧, Creator 요율로 환산하면 약 $6.62 정도예요. Turbo로는 540 크레딧, 약 $4.41 정도고요.
  • 새 계정에 주어지는 무료 크레딧 50개로는 Voice One 기준 약 1,600자, 말하는 시간으로 1분 45초 정도를 만들 수 있어요. 목소리가 맞는지 들어 보기엔 충분하지만, 무언가를 통째로 내레이션하기엔 부족해요.

현실적인 제약이 하나 있어요. 음성 요청 한 번에 최대 5,000자, 약 5분 30초 분량까지 넣을 수 있어요. 어차피 긴 작업은 섹션별로 나누게 되고, 그래야 재녹음 범위도 작게 유지할 수 있어요.

사람 성우는 가격 구조가 달라요. 세션 비용에 사용료가 더해지는 경우가 많고, 금액은 시장, 매체, 사용 기간에 따라 달라져요. 정직하게 제시할 수 있는 단일 금액은 없고, 숫자 하나를 딱 잘라 말하는 사람은 일반화를 하고 있는 거예요. 확실히 말할 수 있는 건 구조예요. 하한선이 있는 프로젝트 단위 가격이라서, 30초짜리 작업이라고 크게 줄지 않고 30분짜리 작업이라고 정비례로 늘지도 않아요.

작업 소요 시간과 일정에 미치는 영향

렌더는 몇 초 만에 돌아와 라이브러리에 저장돼요. 섭외는 일정 조율, 녹음 세션, 납품을 거쳐야 하고, 대부분의 프로젝트에서 하루에서 며칠이 걸려요.

일정에 미치는 영향은 생각보다 커요. 오디오가 하루씩 걸리면 편집이 확정되기도 전에 스크립트부터 굳어 버리고, 편집이 녹음된 낭독에 맞춰 휘어져요. 오디오가 몇 초면 끝난다면 영상을 먼저 편집하고 완성된 타이밍에 맞춰 내레이션을 녹음할 수 있어요. 이게 올바른 순서인데, 실제로 이렇게 작업할 수 있는 사람은 거의 없죠.

차이가 갈리는 곳은 수정이에요

이 비교의 진짜 핵심은 여기예요.

30분짜리 내레이션에서 한 줄을 바꾼다고 해 볼게요. 합성 음성이라면 그 줄만 다시 렌더하면 돼요. 120자 문장은 2블록, Voice One으로 6 크레딧, 약 5센트이고, 수정 메모를 다 읽기도 전에 결과가 돌아와요. 세션 녹음이라면 픽업 녹음 일정을 잡아야 하고, 작은 픽업일수록 관계자 모두에게 지나치게 큰 부담이 생겨요.

생성 음성이 본질적으로 반복이 많은 작업에 잘 맞는 이유도 여기에 있어요. 버전별 광고 카피, 시장별 변형, 출시 전에 두 번이나 바뀌는 제품명 같은 것들이죠. 200자짜리 문장의 변형 10개는 10 × 6 = 60 크레딧이에요. 반올림 오차 수준이고, 덕분에 카피를 실제로 테스트해 볼 수 있어요.

반대로 분명히 말씀드릴 점도 있어요. 디렉션을 줄 수 있는 통로는 텍스트뿐이에요. eroq에서는 문장부호, 속도와 표현력 조절, 그리고 문장 다시 쓰기로 낭독을 조정해요. 쉼표는 속도를 늦추고, 마침표는 문장을 확실히 끝맺고, 물음표는 끝을 올려요. '좀 더 따뜻하게, 두 번째 단어에 힘을 줘서'라고 말할 수는 없어요. 녹음실에서 성우와 함께 있는 디렉터는 할 수 있고, 그건 향수가 아니라 실질적인 능력이에요.

언어와 캐스팅

기본 제공 보이스인 따뜻하고 가까운 느낌의 Aria, 낮고 여유로운 Orion은 각각 13개 언어로 읽어요. 덕분에 현지화는 캐스팅 작업이 아니라 번역 작업이 돼요. 같은 스크립트를 6개 시장에 내려면 섭외 6번이 아니라 렌더 6번과 번역 6번이면 돼요. 자세한 방법은 다국어 보이스오버 가이드에 정리해 뒀어요.

직접 녹음한 오디오로 목소리를 복제할 수도 있어요. 자사 제품 영상을 직접 내레이션하면서 업데이트 때마다 다시 녹음하고 싶지는 않은 창업자에게 딱 맞는 도구죠. 동의 원칙은 절대적이고, 몇 번이고 강조할 만해요. 본인 목소리나 서면 허락을 받은 목소리만 복제하고, 허락 없이 실존 인물의 목소리를 복제해서는 절대 안 돼요. 쓸 만한 샘플의 조건은 음성 복제 가이드에서 다뤄요.

미리 감안해야 할 한계도 두 가지 있어요. eroq에는 립싱크가 없어서, 생성 음성은 화면 속 캐릭터가 입을 맞춰 말하는 용도가 아니라 내레이션과 보이스오버용이에요. 그리고 흔치 않은 고유명사는 제대로 발음되도록 소리 나는 대로 고쳐 써야 할 때가 있어요.

여전히 사람 성우가 정답인 경우

이럴 때는 사람을 섭외하세요.

  • 목소리가 곧 브랜드일 때. 몇 년씩 이어질 캠페인 목소리, 청중이 알아보고 브랜드와 연결 지을 목소리는 사람이 걸린 캐스팅 결정이에요. 배우를 캐스팅하듯 다루세요. 실제로 그런 일이니까요.
  • 낭독에 디렉션이 필요할 때. 코미디, 아이러니, 혹은 타이밍에 좌우되는 섬세한 감정이 담긴 스크립트라면, 실시간으로 디렉션을 받아 반영하는 성우가 프롬프트를 몇 번 고쳐 쓰는 것보다 나아요.
  • 노조, 동의, 권리 문제가 얽혀 있을 때. 방송, 게임, 그리고 많은 에이전시 작업에는 연기에 관한 계약 체계가 있어요. 그럴 만한 이유가 있어서 존재하는 것이고, 선택 사항이 아니에요.
  • 연기자가 누구인지가 제품의 일부일 때. 오디오북의 유명 내레이터, 정말로 본인이 직접 말해야 하는 창업자, 다큐멘터리의 주인공 같은 경우예요.
  • 대사가 장면 속에 자리 잡아야 할 때. 화면 속 대사, 입 모양을 맞추는 ADR, 두 캐릭터의 대사가 겹치는 장면은 내레이션이 아니라 영상과 함께하는 연기 작업이에요.

작업별로 판단하는 방법

대부분의 의뢰는 두 가지 질문으로 정리돼요. 첫째, 이 문장은 바뀔까요? 버전이 여러 개이거나, 현지화하거나, 아직 확정되지 않은 카피라면 수정 비용이 거의 0이니 합성 음성이 압도적으로 유리해요. 둘째, 목소리가 창작을 하나요, 정보를 전달하나요? 튜토리얼, 제품 소개, 직접 쓴 글의 오디오북, 사내 영상, SNS 내레이션 같은 정보 전달은 합성 음성이 강한 영역이에요. 창작 연기는 그렇지 않고요.

가장 흔한 좋은 답은 둘 다예요. 가이드 트랙을 합성해서 실제 타이밍에 맞춰 편집하고, 스크립트를 확정한 다음, 작품이 연기를 받을 만하다면 타이밍이 이미 검증된 상태에서 최종본 녹음을 섭외하세요. 세션 세 번 대신 한 번만 비용을 내면 돼요.

두 음성 엔진은 Voice One vs Voice Turbo에서 나란히 비교해 보고, 플랜별 요율은 요금 페이지에서 확인한 다음, 보이스 스튜디오에서 한 줄 써서 직접 들어 보세요. 긴 분량의 워크플로는 오디오북과 팟캐스트에서 다뤄요.

자주 묻는 질문

AI 보이스오버 1분에 비용이 얼마나 드나요?

Voice One으로 약 27 크레딧, Voice Turbo로 18 크레딧이에요. 말하는 1분이 대략 900자이고, 두 모델이 100자당 각각 3 크레딧과 2 크레딧을 받기 때문이에요. 달러로는 입문 팩 요율 기준 각각 약 27센트와 18센트이고, 플랜에서는 더 저렴해요.

AI 보이스가 성우를 완전히 대체할 수 있나요?

튜토리얼, 제품 영상, 사내 콘텐츠, 현지화처럼 정보를 전달하는 내레이션이라면 대체로 가능해요. 브랜드를 짊어진 연기, 장면 속 대사, 또는 디렉션과 타이밍이 핵심인 작업이라면 여전히 사람이 더 나아요. 어느 쪽이든 가이드 트랙과 초안에는 합성 음성을 쓰는 게 현명한 워크플로예요.

목소리를 복제하는 건 합법인가요?

본인 목소리나 서면으로 사용 허락을 받은 목소리만 복제하세요. 신원을 알아볼 수 있는 실존 인물의 목소리를 동의 없이 복제하는 건 eroq에서 허용되지 않고, 다른 곳에서도 명백한 법적 위험이 따라요. 기본 제공 보이스와 직접 복제한 보이스라면 안전해요.

보이스는 몇 개 언어로 읽을 수 있나요?

기본 제공 보이스는 각각 13개 언어로 읽어요. 그래서 같은 캐스트로 현지화 버전 전체를 소화할 수 있어요. 스크립트를 번역하고 버전별로 렌더하면, 시장이 달라도 전달 톤을 일관되게 유지할 수 있어요.

태그voicettsbudgetingcomparison

이 글에 나온 모델로 직접 만들어 보세요 — 무료 크레딧 50개로 시작하거나, 모든 엔진과 가격도 살펴보세요.