가입하면 프리미엄 플랜 할인할인 받기

블로그/developers·2026년 8월 5일·3분·eroq 팀 작성

AI 캐릭터에게 목소리 입히기: TTS 지연 시간, 비용, 연출

캐릭터 서비스에서 보이스가 들어갈 자리, 음성 합성 비용을 합리적으로 관리하는 법, 생성된 대사를 낭독이 아닌 연기처럼 들리게 하는 디테일.


텍스트는 캐릭터에게 마음을 주고, 목소리는 몸을 줘요. 리텐션 차이는 실제로 있어요. 말하는 캐릭터는 다시 찾게 되거든요. 하지만 보이스는 가장 잘못 만들기 쉬운 기능이기도 해요. 비싸고, 느리고, 밋밋하게요. 저희가 쓰는 플레이북을 공유할게요.

보이스는 모달리티가 아니라 순간이에요

모든 걸 음성으로 만들고 싶은 게 본능이에요. 참으세요. 음성 합성은 입력 글자 수만큼 실제 비용이 들고(Voice One은 100자당 3 크레딧, 더 빠른 Voice Turbo는 2 크레딧), 자동 재생되는 오디오가 쏟아지면 어차피 피곤해요.

보이스는 문장 부호처럼 쓸 때 효과가 있어요. 대화가 시작될 때의 인사, 감정적인 순간, 사용자가 직접 듣고 싶다고 요청한 답변. 보이스를 프리미엄 순간으로 다루는 서비스는 비용을 10분의 1만 쓰고도 더 높은 리텐션을 얻어요. 희소해야 마음에 꽂히니까요.

비용 구조

POST /v1/audio/speech는 시작된 100자 블록 단위로 과금해요. 실제 숫자로 보면 이래요.

대사 글자 수 크레딧 비용(약)
짧은 인사 80 3 $0.03
일반적인 답변 240 9 $0.09
긴 극적인 장면 600 18 $0.18

여기서 두 가지를 알 수 있어요. 첫째, 목소리를 위해 쓰세요. 말로 하는 대사는 어차피 글로 쓴 문장보다 짧아야 해요. 200자로 다듬는 건 연출을 개선하면서 비용도 절반으로 줄이는 일이에요. 둘째, 적극적으로 캐시하세요. 인사말, 입버릇, 반복되는 장면은 매번 같은 오디오예요. voice + text를 해시하고 MP3를 직접 저장하세요. 모든 대사는 라이브러리에도 저장되지만, 다시 재생할 때 비용이 들지 않게 해 주는 건 직접 관리하는 캐시예요. 그러면 재생의 상당 부분이 무료가 돼요.

지연 시간과 체감 속도

합성에는 1~2초가 걸려요. 요령은 체감 지연 시간이 UI의 문제라는 점이에요.

  • 텍스트 답변은 즉시 보여 주고, 오디오는 은은한 '음성 불러오는 중' 표시와 함께 뒤따라 도착하게 하세요. 사용자는 렌더되는 동안 글을 읽어요.
  • 정해진 순간(온보딩, 인사)은 미리 생성하세요. 그런 대사는 사용자가 오기도 전에 이미 정해져 있어요.
  • 오디오 때문에 대화를 막지 마세요. 실패한 보이스는 턴을 오류로 만들지 말고 조용히 텍스트로 대체되어야 해요.

연기처럼 들리게 만들기

'소리 내어 읽기'와 '연기'의 차이는 대부분 입력 텍스트에 있어요.

  • 문장 부호가 곧 운율이에요. 쉼표, 대시, 말줄임표로 호흡과 속도를 연출해요. "글쎄… 이건 새롭네."는 연기가 되고, "글쎄 이것은 새롭다"는 낭독이 돼요.
  • 캐릭터의 목소리는 단어에 담으세요. 합성 보이스는 음색을 전하고, 개성은 글이 전해요. 냉소적인 캐릭터에게 필요한 건 냉소적인 보이스 설정이 아니라 냉소적인 문장이에요.
  • 보이스와 캐릭터는 한 번 맞추고 절대 바꾸지 마세요. 보이스 정체성이 곧 캐릭터 정체성이에요. 관계 도중에 보이스를 바꾸는 건 오디오판 아바타 바꿔치기예요.

기본 보이스(따뜻하고 친밀한 aria, 낮고 느긋한 orion, 레퍼런스 참고)는 일부러 무한히 늘리지 않고 엄선했어요. 가끔 어울리는 마흔 개보다 늘 제대로 들리는 두 개가 낫고, 둘 다 13개 언어를 읽어요. 둘 다 캐릭터에 맞지 않으면 직접 녹음한 오디오로 목소리를 복제해서 그걸 캐스팅하세요.

왕복: 귀도 함께

같은 오디오 파이프라인이 반대 방향으로도 돌아가요. /v1/audio/transcriptions(오디오 1분당 1 크레딧)는 사용자의 음성 메시지를 캐릭터가 답할 수 있는 텍스트로 바꿔요. 음성 입력, 텍스트 추론, 음성 출력이 '통화 모드'의 전체 루프이고, 각 구간은 API 호출 한 번이에요.

자주 묻는 질문

AI 텍스트 음성 변환(TTS)은 대사 한 줄에 얼마인가요?

Voice One은 시작된 100자마다 3 크레딧, Voice Turbo는 같은 기본 보이스와 같은 복제 음성으로 2 크레딧을 과금해요. 240자 답변은 Voice One에서 9 크레딧으로, 약 9센트예요. 대사를 짧게 쓰는 건 연출 개선이자 비용을 절반으로 줄이는 가장 저렴한 방법이에요.

캐릭터 목소리를 복제할 수 있나요?

네. 보이스 스튜디오에서 직접 녹음한 오디오를 업로드하면 복제 음성이 내 보이스 목록에 추가되고, aria나 orion처럼 API에서 캐스팅할 수 있어요. 캐릭터에게는 복제 음성이나 기본 보이스를 한 번 지정할 수 있고, 그렇게 해서 관계 내내 보이스 정체성을 안정적으로 유지해요.

보이스는 어떤 언어를 말하나요?

두 음성 모델 모두 13개 언어를 읽고, 복제 음성도 그 언어들에서 그대로 쓸 수 있어요. 언어는 별도 파라미터가 아니라 보내는 텍스트로 정해지기 때문에, 캐릭터가 같은 음색으로 사용자의 언어로 답할 수 있어요.

eroq에서 목소리를 영상이나 아바타에 립싱크할 수 있나요?

아니요. 립싱크도, 말하는 아바타 기능도, 실시간 음성도 없어요. 음성 합성은 직접 재생하는 MP3를 반환해요. 이 순간은 스틸 이미지에 붙은 음성 메모로 설계하세요. 실제 서비스에서도 그게 잘 통해요. 둘을 한 타임라인에 올려야 한다면 동영상 편집 프로그램으로 내보내세요.

인사부터 시작하세요. 캐릭터마다 캐시한 대사 한 줄, 대사당 몇 크레딧, 오후 한나절이면 출시할 수 있어요. 그게 둘째 날 리텐션에 어떤 영향을 주는지 측정한 다음, 얼마나 더 확장할지 정하세요. 저희 경험상, 서비스를 바꾸는 건 바로 그 첫 오후예요.

태그voicettscharacters

이 글에 나온 모델로 직접 만들어 보세요 — 무료 크레딧 50개로 시작하거나, 모든 엔진과 가격도 살펴보세요.