보이스
화자 분리(Diarization)
화자 분리는 음성 인식에서 누가 언제 말했는지 파악해, 받아 적은 텍스트에 화자별로 표시하는 기능이에요. 인터뷰를 받아 적은 텍스트 덩어리를 읽기 쉬운 대화록으로 바꿔 주는 게 바로 이 기능이에요.
소리를 글로 바꾸는 모델과는 별개의 모델이에요. 그래서 많은 음성 인식 서비스가 텍스트는 정확하게 돌려주면서도 화자 표시는 전혀 하지 않아요.
단어 단위 타임스탬프는 관련은 있지만 별개의 기능이고, 자막 파일에 실제로 필요한 건 이쪽이에요.
eroq에서는
Scribe One은 오디오 분당 1 크레딧으로 텍스트를 돌려주고, 언어를 자동으로 감지해요. 화자 분리, 단어 단위 타임스탬프, 자막 파일 생성은 하지 않아요. 그래서 인터뷰를 잘게 편집하는 용도보다는 내 내레이션에 자막을 다는 용도에 맞아요.
자주 묻는 질문
eroq로 녹음에서 누가 무슨 말을 했는지 구분할 수 있나요?
아니요. Scribe One은 화자 표시 없이 말한 내용의 텍스트만 돌려주므로, 여러 사람이 말하는 녹음도 하나로 이어진 텍스트로 받게 돼요.
자막용 SRT 파일을 받을 수 있나요?
eroq에서는 안 돼요. 단어 단위 타임스탬프도, 자막 출력도 없어요. 받아 적은 텍스트를 자막 도구로 가져가서 쓰세요.
그럼 eroq의 음성 인식은 어디에 쓰면 좋나요?
내 내레이션을 다시 텍스트로 바꾸는 데 좋아요. 타이밍을 직접 맞추는 자막, 설명문, 또는 생성한 음성이 실제로 무슨 말을 했는지 확인하는 용도로요.