eroq api · 보이스
텍스트에 목소리를.
목소리는 다시 텍스트로.
100자당 2~3 크레딧의 음성 합성 모델 두 개, 엄선한 기본 보이스, 깨끗한 녹음으로 하는 음성 복제. 캐릭터에 목소리를 지정하면 그 캐릭터의 모든 대사가 같은 목소리로 나오고, 같은 키로 오디오를 다시 텍스트로 변환할 수 있어요.
MP3 출력 · 13개 언어 · 복제 음성은 내 계정 전용
가입 시 무료 크레딧 50개 · 카드 등록 불필요
curl https://eroq.ai/v1/audio/speech \
-H "Authorization: Bearer $EROQ_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "eroq-voice-one",
"input": "That noise is the reactor missing its coolant flush. [sighing] Again.",
"voice": "aria"
}' \
--output speech.mp3모델
모델 3개. 가격은 고정.
Voice One
speecheroq-voice-one
엄선한 기본 보이스로 자연스러운 음성을 합성해요. MP3 오디오를 바로 반환해요.
3 크레딧 / 100자
Voice Turbo
speecheroq-voice-turbo
대량 처리용 보이스 티어예요. 지연 시간은 더 짧고 가격은 더 낮으며, Voice One과 같은 기본 보이스와 복제 음성을 그대로 쓸 수 있어요.
2 크레딧 / 100자
Scribe One
transcriptioneroq-scribe-one
언어를 자동으로 감지하는 음성 인식 모델로, 음성 메시지 길이의 오디오에 맞춰 설계했어요.
1 크레딧 / 분
제공 기능
Voice, 실제 출시하는 제품을 위해 만들었어요.
두 가지 속도
Voice One은 100자당 3 크레딧, Voice Turbo는 2 크레딧이에요. 요청 형식도 기본 보이스도 같아요 — 대사가 연기가 아니라 알림일 때, Turbo는 약간의 뉘앙스를 내주는 대신 지연 시간과 비용을 아껴요.
목소리 복제
깨끗한 녹음을 업로드하면 복제한 목소리는 오직 내 것이에요 — 내 계정 전용으로, API, 스튜디오, 그리고 지정한 모든 캐릭터에서 쓸 수 있어요. 공유 보이스 목록에 공개되지 않고, 다른 누구도 접근할 수 없어요.
말하는 캐릭터
저장한 캐릭터에 목소리를 연결하면, 호출이 내 제품에서 오든 영화나 스튜디오에서 오든 그 캐릭터의 모든 대사가 그 목소리로 나와요. 모든 호출 지점에 보이스 ID를 일일이 넘기는 대신, 한 번만 지정하면 돼요.
텍스트 안의 연출
속도와 표현력은 파라미터이고, 나머지 연기는 입력 텍스트 안에 있어요: 두 엔진 모두 문장 부호(쉼표, 말줄임표, 줄바꿈)를 연출로 읽고, Voice One은 [whispering]이나 [laughing] 같은 대괄호 태그를 소리 내 읽지 않고 연기해요. 배워야 할 SSML 방언도, 틀릴 SSML 방언도 없어요.
13개 언어
같은 목소리로 13개 언어를 말할 수 있어서, 복제한 내레이터가 그 언어로 녹음한 적 없는 원고도 읽을 수 있어요. 발음은 텍스트를 따르므로 숫자와 이름은 풀어서 쓰는 게 좋아요.
그리고 다시 텍스트로
음성 인식은 같은 키로 오디오 1분당 1 크레딧에 실행돼서, 내가 만든 내레이션에 자막을 다는 작업까지 한 흐름으로 끝낼 수 있어요. 화자 분리와 단어 단위 타임스탬프는 없으므로, 자막 파일이 아니라 텍스트를 반환해요.
자주 묻는 질문
핵심만 짧게.
음성 합성 비용은 얼마인가요? +
보내는 텍스트 기준으로 Voice One은 100자당 3 크레딧, Voice Turbo는 2 크레딧이에요. 음성 인식은 오디오 1분이 시작될 때마다 1 크레딧이에요.
내가 복제한 목소리는 누가 쓸 수 있나요? +
내 계정만 쓸 수 있어요. 복제 음성은 비공개이고 공유 보이스 목록에 추가되지 않으며, 삭제할 수 있어요. 삭제하면 지정되어 있던 모든 캐릭터에서도 제거돼요.
어떤 형식으로 받나요? +
MP3예요. 오디오 스트리밍 엔드포인트가 없어서, 긴 글도 말하는 대로 흘러나오는 게 아니라 완성된 파일 하나로 도착해요.
생성한 얼굴에 립싱크를 맞출 수 있나요? +
아니요. 음성과 동영상은 별도 호출이고, 립싱크 도구는 없어요. Veo 3.1은 클립의 일부로 대사를 렌더링할 수 있지만, 기존 클립에 음성 트랙을 얹어 입 모양을 맞출 수는 없어요.
음성 인식 결과에 타임스탬프가 포함되나요? +
아니요 — 텍스트만 반환해요. 화자 분리, 단어 단위 타이밍, 자막 파일이 없으므로 자막은 편집기에서 한 번 더 손봐야 해요.