블로그/guides·2026년 9월 2일·4분·eroq 팀 작성
AI 음성 복제, 보이스 샘플은 얼마나 길어야 할까요?
30초~3분이라는 기준, 녹음 공간, 마이크 거리, 복제 음성에 표현 폭을 주는 낭독 원고, 그리고 샘플을 조용히 망치는 네 가지 습관을 정리했어요.
음성 복제에 관한 질문은 결국 샘플에 관한 질문으로 이어져요. 샘플이 곧 복제 음성이니까요. 엔진은 컨디션 좋은 날 내 목소리가 어떤지 전혀 몰라요. 아는 건 내가 건넨 90초뿐이고, 거기엔 옆방 냉장고 소리까지 들어 있어요. 무엇을, 얼마나 녹음해야 하는지, 그리고 멀쩡한 테이크를 조용히 망치는 몇 가지 습관을 정리했어요.
권장 범위, 그리고 범위인 이유
보이스 스튜디오의 복제 양식은 돌려 말하지 않아요. 끊김 없는 자연스러운 말하기 30초에서 3분. 클립을 이어 붙인 30초가 아니라, 실제로 이야기하는 30초예요.
30초 미만이면 엔진은 한 가지 억양과 한 가지 음역만 듣게 되고, 딱 그것만 영원히 기꺼이 재현해요. 3분을 넘기면 대부분 이미 배운 것을 더 얹는 셈이고, 기침, 휴대폰 진동, 마이크에서 멀어진 문장처럼 파일에 문제가 생길 확률은 1분이 늘 때마다 올라가요.
가이드의 나머지 절반이 숫자보다 더 중요해요. 길이보다 깨끗함이에요. 깨끗한 1분이 잡음 섞인 10분보다 나아요. 웅웅거리는 소리가 섞인 3분짜리 테이크와 그런 소리가 없는 50초짜리 테이크 중 하나를 고를 수 있다면, 50초짜리를 올리세요.
마이크보다 방이 더 중요해요
음성 복제는 들리는 그대로 복사하고, "그건 방 소리였어"라는 개념이 없어요. 잔향도 음색의 일부로 학습돼요. 그래서 부엌에서 녹음한 복제 음성은 영원히 부엌에 있는 것처럼 들려요.
- 뻔한 소음원부터 없애세요. 에어컨, 선풍기, 냉장고, 거리 쪽으로 열린 창문.
- 부드러운 곳에서 녹음하세요. 커튼, 침대, 소파, 코트로 가득 찬 옷장. 메아리는 서로 마주 보는 단단한 면에서 생겨요.
- 휴대폰은 비행기 모드로 두세요. 책상을 타고 전해지는 알림 진동은 방에서 들릴 때보다 녹음에서 더 크게 들려요.
화자는 한 명, 거리는 하나
여기서도 양식은 분명해요. 혼자 말하는 목소리만, 다른 사람 목소리가 겹치지 않게, 인터뷰어 없이. 그리고 방 소리가 들리지 않을 만큼 마이크를 가까이 두라고요.
거리를 하나 정해서 테이크 내내 유지하세요. 속삭이는 대사에서는 다가가고 큰 소리에서는 물러나는 건 라이브 낭독에서는 좋은 마이크 테크닉이지만, 복제용 입력으로는 최악이에요. 엔진이 서로 다른 두 목소리를 듣고 평균을 내 버리거든요. 파열음이 마이크 캡슐을 때리지 않고 비켜 가도록, 마이크 정면에서 살짝 비껴 앉으세요.
표현 폭이 있는 글을 읽으세요
대부분이 건너뛰는 부분인데, 연기할 줄 아는 복제 음성과 안내 방송만 할 줄 아는 복제 음성의 차이가 여기서 나요. 엔진은 음색만이 아니라 말투까지 복제해요. 밋밋한 문단 하나를 읽으면 밋밋한 목소리 하나가 나와요.
평서문, 질문, 나열, 조용한 문장과 날카로운 문장을 모두 넣으세요. 아래는 이 모든 걸 약 90초 안에 담은 원고예요. 평소 말하는 속도로 읽고, 연기하지는 마세요.
좋아요, 제대로 해 볼게요. 제 이름은 마라고, 이건 음성 복제용 샘플이에요. 소리 내서 말하니 참 이상한 문장이네요.
먼저 평범한 문장. 주전자 물이 끓은 지 10분이 지났는데 아무도 차를 안 탔어요.
이제 질문이에요. 정말로 그게 될 거라고 생각해요?
나열은 제가 실제로 목록을 읽는 방식대로. 열쇠, 지갑, 충전기, 그리고 매번 깜빡하는 그거 하나.
이번엔 조용한 문장이에요. 그렇게 말하고 싶지 않았어요. 그래도 말할게요.
그리고 날카로운 문장. 아니요. 우리가 합의한 건 그게 아니에요. 당신도 알잖아요.
마지막으로 끝맺는 한 줄은 서두르지 않고, 거의 잠든 사람에게 책 한 장의 끝부분을 읽어 주듯이.
이름은 바꾸고, 구성은 그대로 두세요. 복제 음성을 차분한 내레이션, 광고 낭독, 날 선 캐릭터처럼 한 가지 용도로 쓸 거라면 원고를 그쪽으로 기울이되, 대비되는 줄을 최소 한 줄은 남겨 두세요. 그래야 복제 음성이 목소리가 움직일 수 있다는 걸 알아요.
샘플을 망치는 네 가지 습관
- 목소리 아래 깔린 음악이나 배경음. 나중에 분리할 방법이 없어요. 배경 음악은 복제 음성의 일부가 돼요.
- 후처리. 컴프레서, 노이즈 게이트, 디에서, 녹음 앱의 "음성 향상" 스위치는 모두 엔진이 원하던 정보를 지워요. 다듬은 소리보다 날것이 더 좋은 입력이에요.
- 3분 내내 한 가지 감정. 밋밋하게 넣으면 밋밋하게 나와요.
- 앞뒤의 무음. 첫 단어 앞과 마지막 단어 뒤의 침묵은 잘라 내세요. 해롭진 않지만, 아까운 분량만 낭비해요.
업로드, 그리고 그다음
복제 양식은 MP3, WAV, M4A, FLAC, MP4, MOV, WEBM, WEBA, OPUS, MID를 받고, 샘플은 최대 20개, 합계 1 GB까지 올릴 수 있어요. 가이드가 권하는 분량보다 훨씬 넉넉하죠. 복제 음성에는 6개월 뒤에도 알아볼 수 있는 이름을 붙이세요("테스트 3"보다 "마라 — 내레이션"이 나아요).
복제 자체는 무료이고 바로 완료돼요. 복제 음성은 기본 보이스 Aria, Orion과 나란히 보이스 목록에 들어가고, 두 음성 합성 모델 모두에서 작동해요. 비용이 드는 건 그 음성으로 렌더하는 음성이에요. Voice One은 100자당 3 크레딧, Voice Turbo는 2 크레딧이에요.
믿기 전에 먼저 오디션하세요
프로젝트에 쓰기 전에 같은 대사를 두 모델로 렌더해 보세요. 멋진 문장보다 쉼, 질문, 딱 끊는 마침이 들어간 대사가 더 많은 걸 알려 줘요.
기다렸어요. 빗속에서 두 시간이나요. 고작 그 말 들으려고요? 아니요, 설명하지 마세요. 다 필요 없어요. 진짜인 거 하나만, 딱 하나만 말해 줘요. 그러면 아무 말 없이 조용히 갈게요.
이 대사는 104자이고, 과금은 100자 단위 블록으로 세며 시작된 블록은 모두 계산돼요. 그래서 두 블록, Voice One에서 6 크레딧, Turbo에서 4 크레딧이에요. 결과가 낯선 사람 목소리처럼 들린다면, 해결책은 거의 언제나 설정이 아니라 샘플이에요. 더 부드러운 방에서, 더 가까이, 더 다양하게 다시 녹음하고 다시 복제하세요. 나머지 워크플로는 음성 복제 가이드에서, 최종본을 어떤 모델로 렌더할지는 Voice One vs Voice Turbo에서 다뤄요.
자주 묻는 질문
보이스 샘플은 길수록 항상 좋나요?
아니요. 권장 길이는 30초에서 3분이고, 그 범위 안에서는 길이보다 깨끗함이 중요해요. 깨끗한 1분이 잡음 섞인 10분보다 나아요. 1분이 늘 때마다 기침, 웅웅거리는 소리, 마이크에서 멀어진 문장이 녹음될 기회가 하나 더 생기니까요.
짧은 녹음 여러 개를 합쳐서 하나의 복제 음성을 만들 수 있나요?
샘플은 최대 20개까지 올릴 수 있지만, 짧은 클립 더미보다 끊김 없는 자연스러운 말하기가 더 나아요. 클립마다 녹음한 방이나 거리가 다르면 엔진은 일관되지 않은 목소리를 듣고 평균을 내요. 한 번에 이어서 읽은 녹음이 더 좋은 입력이에요.
휴대폰으로 녹음해도 복제가 되나요?
네, 마이크처럼 다룬다면요. 일정한 거리를 유지하고, 부드러운 방에서 녹음하고, 녹음 앱의 "음성 향상" 같은 처리는 모두 끄고, 스피커폰이나 차 안에서는 녹음하지 마세요. 옷장 속 휴대폰이 부엌의 좋은 마이크보다 나아요.
복제 음성이 제 목소리 같지 않으면 어떻게 하나요?
슬라이더에 손대기보다 다시 녹음하세요. 속도와 표현력은 낭독을 샘플에서 멀어지게 하는 설정이라, 목소리의 정체성 자체가 틀렸다면 고칠 수 없어요. 더 가깝고, 더 조용하고, 더 다양한 샘플이 진짜 해결책이에요.
녹음할 준비가 됐나요? 보이스 스튜디오를 열고 보이스 목록에서 복제한 다음, 첫 크레딧은 대본 전체가 아니라 오디션용 대사 한 줄에 쓰세요.
이 글에 나온 모델로 직접 만들어 보세요 — 무료 크레딧 50개로 시작하거나, 모든 엔진과 가격도 살펴보세요.