가입하면 프리미엄 플랜 할인할인 받기

보이스

음성 텍스트 변환(STT)

음성 텍스트 변환(STT)은 말소리 오디오를 글로 받아 적는 기술이에요. 채팅 모델, TTS와 함께 쓰면 음성 대화 루프가 완성돼요.

실무에서 따져 볼 요소는 언어 감지, 파일 크기 제한, 그리고 요청당 또는 분당 가격이에요.

eroq에서는

Scribe One: 오디오 분당 1 크레딧(분 단위 올림), 최대 8 MB 파일, 언어 자동 감지.

자주 묻는 질문

음성 인식 비용은 얼마인가요?

Scribe One은 오디오 분당 1 크레딧(분 단위 올림)이에요. 음성 메모 하나는 1 크레딧, 한 시간 분량의 오디오는 60 크레딧이에요.

Scribe One은 어떤 오디오를 받을 수 있나요?

최대 8 MB의 wav 또는 mp3 파일 하나를 받아요. 압축된 음성으로 대략 8분 분량이에요. 언어는 자동으로 감지되고, 언어 코드로 힌트를 줄 수도 있어요. 더 긴 녹음은 나눠서 올려야 해요. 과금은 파일마다 분당 1 크레딧(분 단위 올림)이라, 나눠도 올림으로 생기는 차이만큼만 더 들어요.

음성 인식 결과에 타임스탬프나 화자 구분이 포함되나요?

아니요. 응답은 오디오를 받아 적은 텍스트뿐이에요. 화자 분리도, 단어 단위 타이밍도, 자막 파일도 없으니 자막은 받은 텍스트로 다음 단계에서 만들어야 해요.