블로그/guides·2026년 9월 10일·5분·eroq 팀 작성
크리에이터용 AI 음성 생성기 추천: 결제 전에 테스트할 것
표현력, 글자당 가격, 음성 복제, 언어, 출력 형식으로 AI 음성 생성기를 고르는 법. Voice One과 Voice Turbo 비용 계산까지.
TTS 데모는 다 좋게 들려요. 데모란 원래 좋게 들리도록 고른 문장이니까요. 돈을 낼 만한 보이스는 가장 까다로운 문단에서도 버티는 보이스예요. 전화번호가 들어 있고, 약어가 섞여 있고, 아무도 제대로 발음하지 못하는 브랜드명이 나오고, 담백하게 툭 던져야 하는 문장이 있는 그런 문단이요. 이 가이드는 데모가 아니라 기준으로 고르는 법, 글자당 비용을 정직하게 계산하는 법, 그리고 프로젝트를 보이스에 맡기기 전에 오디션 스크립트를 돌려 보는 법을 다뤄요.
체크해야 할 기준, 문제가 되는 순서대로
1. 표현력 vs 예측 가능성. 표현력이 풍부한 모델은 강세와 호흡에서 과감하게 시도해요. 빠른 모델은 정직하게 읽어요. 20분이 넘는 내레이션에서는 대개 예측 가능한 쪽이 이기고, 캐릭터 대사에서는 표현력이 이겨요. Voice One과 Voice Turbo가 바로 이 트레이드오프를 대표해요. 무조건 비싼 쪽을 고르기보다 의도를 갖고 선택할 가치가 있어요.
2. 조절 기능. 보이스만 바꿀 수 있나요, 아니면 속도와 표현력도 바꿀 수 있나요? /studio/voice에서는 둘 다 장식이 아니라 엔진에 직접 연결된 슬라이더예요.
3. 음성 복제. 내 오디오를 넣었을 때 그 목소리를 그대로 돌려받을 수 있는지예요. 어떤 오디오가 필요한지, 복제한 뒤 어디에 저장되는지, 모든 모델에서 쓸 수 있는지 아니면 하나에서만 되는지 물어보세요. eroq에서는 직접 녹음한 오디오로 복제하고, 두 음성 모델 모두와 연결한 모든 캐릭터에서 쓸 수 있어요.
4. 언어. 지원 언어 수를 세고, 그다음 어떤 보이스가 실제로 그 언어를 지원하는지 확인하세요. 기본 제공 보이스 Orion은 13개 언어를 지원해요. 보이스 라인업이 다국어라고 해도, 실제로 다국어인 건 개별 보이스가 지원하는 범위까지예요.
5. 출력 형식과 그 활용. Voice One은 MP3로 출력되고, 라이브러리에 자동 저장되며, API로 스트리밍할 수 있어요. 브라우저에서 재생만 되고 파일을 내주지 않는 도구라면, 그건 파이프라인이 아니라 데모예요.
6. 글자당 가격은 무엇이든 비교할 수 있게 해 주는 유일한 가격 단위예요. 분당 가격은 읽는 속도를 감추고, 단어당 가격은 문장부호를 감춰요. 글자는 그냥 글자예요.
7. 정책과 동의. 사용 허락을 받지 않은 목소리의 복제는 아예 불가능해요. 동의 없이 신원을 알아볼 수 있는 실존 인물을 다루는 건 전면 금지이고, 목소리도 예외가 아니에요. 가상의 캐릭터, 본인 목소리, 라이선스를 받은 목소리는 괜찮아요.
8. API가 있는지, 그리고 그게 UI가 쓰는 것과 같은지. 스튜디오와 API가 따로 놀면, 프로토타입으로 만든 것과 실제로 출시할 것이 달라져요.
Voice One vs Voice Turbo: 비용 계산
두 모델은 보이스 라인업도, 복제 음성도, 조절 기능도 같아요. 차이는 100자당 3 크레딧 대 2 크레딧이에요.
- 30초 광고 낭독은 약 450자라 Voice One으로 15 크레딧, Turbo로 10 크레딧이에요. 어느 쪽이든 푼돈이에요.
- 60초 보이스오버는 약 900자라 27 크레딧 대 18 크레딧. 여전히 거의 공짜예요.
- 10분짜리 에피소드는 약 9,000자라 270 크레딧 대 180 크레딧. 입문 팩 요율로는 약 $2.70 대 $1.80 정도예요.
- 60,000단어 분량의 오디오북은 약 360,000자라 10,800 크레딧 대 7,200 크레딧. Studio 플랜 요율로는 대략 $80 대 $54예요.
비율은 절대 변하지 않아요. Turbo가 언제나 3분의 1 더 저렴해요. 결국 선택은 전적으로 표현력이 어디서 중요한지에 달려 있어요. 평탄하고 일관된 낭독이 목표인 긴 내레이션인가요? Turbo를 쓰고, 아낀 비용으로 테이크를 더 뽑으세요. 캐릭터 대사, 감정이 실리는 순간, 전달력에 성패가 갈리는 광고인가요? Voice One이에요. 한 프로젝트 안에서 섞어 써도 괜찮아요. 보이스는 똑같고, 연기하는 모델만 바뀌니까요.
문장부호가 곧 디렉션이에요
어느 플랫폼이든 믿을 만한 별도의 '감정' 파라미터는 없어요. 실제로 전달 방식을 이끄는 건 텍스트 자체이고, 좋은 결과를 얻는 크리에이터들은 엔진을 위해 글을 써요.
- 쉼표는 한 박자, 마침표는 한 호흡. 문장 하나를 둘로 나누면 어떤 슬라이더보다 호흡이 크게 바뀌어요.
- 말줄임표는 머뭇거림을 만들어요… 한 번만 쓸 때는요. 한 문단에 세 번 쓰면 지루해하는 내레이터가 돼요.
- 대시는 말을 끊어요 — 이렇게요. 말이 끊기거나 스스로 정정하는 장면에 좋아요.
- 물음표는 끝을 올려요. 그러니 글로는 평서문이 더 자연스러워 보여도 의문문으로 쓰세요.
- 영문 대문자(ALL CAPS)는 볼륨이 아니에요. 강조는 어순으로 표현하거나, 구절을 나누세요.
- 숫자는 읽는 대로 쓰세요. 그 문자열을 직접 테스트해 본 게 아니라면 '1995'가 아니라 '천구백구십오'로요.
보이스 에디터의 연기 문법 가이드에 이런 규칙들이 클릭 한 번으로 넣을 수 있는 예시 문장과 함께 정리되어 있어요. 직접 다시 알아내는 것보다 훨씬 빨라요.
오디션 스크립트
데모만 듣고 보이스를 고르지 마세요. 이 스크립트나 이와 비슷한 걸로 고르세요. 잘못될 수 있는 요소가 전부 들어 있거든요.
저기요 — 짧게 하나만요. 2027년 3월 3일에 API를 v2로 옮겨요. 그러니까 지금 eroq.ai/v1을 쓰고 계시다면 6개월 정도 남은 거예요. 그전까지는 아무것도 깨지지 않아요. 궁금한 점이요? 여기에 답장하시거나 555-0142, 내선 9번으로 전화 주세요. 그리고 네… 알아요. 또 마이그레이션이죠. 죄송해요.
후보 보이스마다 같은 속도 설정으로 이 문단을 돌려 보고, 다섯 가지를 들어 보세요. 대시, 날짜, URL, 전화번호, 그리고 '그리고 네… 알아요'가 담백하게 떨어지는지 아니면 과하게 연기되는지. 300자가 채 안 되는(영어 원문은 270자) 이 문단 하나가 데모 릴 한 시간보다 더 많은 진실을 알려 줘요. eroq에서는 Voice One으로 9 크레딧, Turbo로 6 크레딧이면 충분하니, 1달러도 안 되는 돈으로 보이스 네 개를 오디션할 수 있어요.
연동하기
스튜디오와 API는 같은 기반 위에 있어서, 에디터에서 다듬은 설정은 무엇이든 호출 한 번이면 그대로 쓸 수 있어요.
curl -X POST https://eroq.ai/v1/audio/speech \
-H "Authorization: Bearer $EROQ_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "eroq-voice-turbo",
"voice": "aria",
"input": "Hey — quick one. On March 3rd, 2027, we are moving the API to v2."
}' --output audition.mp3
eroq-voice-turbo를 eroq-voice-one으로 바꿔서 두 파일을 귀로 비교해 보세요. aria를 복제 음성 id로 바꾸거나, char:<id>로 바꾸면 캐릭터의 목소리를 쓸 수 있어요. 전체 레퍼런스는 /docs/speech에 있고, 채팅 서비스에 보이스를 연동하는 방법은 AI 캐릭터를 위한 TTS에서 따로 다뤄요.
프로젝트를 맡기기 전에
- 샘플이 아니라 내 스크립트로 오디션하세요.
- 가장 짧은 문단이 아니라, 앞으로 보낼 가장 긴 문단으로 테스트하세요.
- 결정하기 전에 복제해 보세요. 내가 가진 목소리의 복제 음성이 특정한 말투에서는 기본 제공 보이스 전부를 이기는 경우가 많아요.
- 프로젝트 전체 비용을 글자 수로 계산한 뒤 /pricing과 비교해 보세요. 3 대 2의 차이가 마침내 드러나는 건 긴 분량의 프로젝트예요.
- 파일 하나를 생성해서 휴대폰 스피커로 들어 보세요. 헤드폰으로는 뭐든 좋게 들려요.
자주 묻는 질문
Voice One과 Voice Turbo의 차이는 무엇인가요?
Voice One은 100자당 3 크레딧의 표현력 높은 플래그십이고, Voice Turbo는 2 크레딧으로 더 빨라요. 보이스 라인업, 복제 음성, 속도와 표현력 조절은 똑같아요. 길고 평탄한 내레이션에는 Turbo를, 전달력이 대사를 좌우하는 곳에는 Voice One을 쓰세요.
AI 내레이션 1시간에는 비용이 얼마나 드나요?
말하는 1시간은 대략 54,000자라서 Voice One으로 약 1,620 크레딧, Voice Turbo로 1,080 크레딧이에요. 팩이나 플랜에 따라 대략 $8에서 $16 수준이에요. 분이 아니라 글자 수로 계산하세요.
내 목소리를 복제할 수 있나요?
네, 직접 녹음한 오디오로 복제할 수 있고, 복제한 음성은 두 음성 모델 모두와 연결한 모든 캐릭터에서 쓸 수 있어요. 실존 인물의 목소리를 본인 동의 없이 복제하는 건 허용되지 않아요.
1달러도 안 되는 비용으로 보이스 네 개를 오디션해 보세요: /studio/voice
이 글에 나온 모델로 직접 만들어 보세요 — 무료 크레딧 50개로 시작하거나, 모든 엔진과 가격도 살펴보세요.