가입하면 프리미엄 플랜 할인할인 받기

보이스

화자 분리(Diarization)

화자 분리는 음성 인식에서 누가 언제 말했는지 파악해, 받아 적은 텍스트에 화자별로 표시하는 기능이에요. 인터뷰를 받아 적은 텍스트 덩어리를 읽기 쉬운 대화록으로 바꿔 주는 게 바로 이 기능이에요.

소리를 글로 바꾸는 모델과는 별개의 모델이에요. 그래서 많은 음성 인식 서비스가 텍스트는 정확하게 돌려주면서도 화자 표시는 전혀 하지 않아요.

단어 단위 타임스탬프는 관련은 있지만 별개의 기능이고, 자막 파일에 실제로 필요한 건 이쪽이에요.

eroq에서는

Scribe One은 오디오 분당 1 크레딧으로 텍스트를 돌려주고, 언어를 자동으로 감지해요. 화자 분리, 단어 단위 타임스탬프, 자막 파일 생성은 하지 않아요. 그래서 인터뷰를 잘게 편집하는 용도보다는 내 내레이션에 자막을 다는 용도에 맞아요.

자주 묻는 질문

eroq로 녹음에서 누가 무슨 말을 했는지 구분할 수 있나요?

아니요. Scribe One은 화자 표시 없이 말한 내용의 텍스트만 돌려주므로, 여러 사람이 말하는 녹음도 하나로 이어진 텍스트로 받게 돼요.

자막용 SRT 파일을 받을 수 있나요?

eroq에서는 안 돼요. 단어 단위 타임스탬프도, 자막 출력도 없어요. 받아 적은 텍스트를 자막 도구로 가져가서 쓰세요.

그럼 eroq의 음성 인식은 어디에 쓰면 좋나요?

내 내레이션을 다시 텍스트로 바꾸는 데 좋아요. 타이밍을 직접 맞추는 자막, 설명문, 또는 생성한 음성이 실제로 무슨 말을 했는지 확인하는 용도로요.