Voz
Diarización
La diarización es la parte de la transcripción que determina quién habló y cuándo, y etiqueta la transcripción por hablante. Es lo que convierte el muro de texto de una entrevista en una conversación legible a dos columnas.
Es un modelo distinto del que convierte el sonido en palabras, y por eso muchos servicios de transcripción devuelven un texto preciso sin ninguna etiqueta de hablante.
Las marcas de tiempo por palabra son una función relacionada pero distinta, y la que de verdad necesitan los archivos de subtítulos.
En eroq
Scribe One devuelve texto, a 1 crédito por minuto de audio, con detección automática del idioma. No hace diarización, no devuelve marcas de tiempo por palabra ni genera un archivo de subtítulos, así que sirve para subtitular tu propia narración más que para despiezar una entrevista.
Preguntas
¿Puede eroq etiquetar quién dijo qué en una grabación?
No. Scribe One devuelve el texto de lo que se dijo sin etiquetas de hablante, así que una grabación con varias personas llega como una sola transcripción continua.
¿Puedo obtener un archivo SRT para subtítulos?
No desde eroq: no hay marcas de tiempo por palabra ni salida de subtítulos. La transcripción es texto que llevas a una herramienta de subtitulado.
Entonces, ¿para qué sirve aquí la transcripción?
Para convertir tu propia narración de nuevo en texto: para subtítulos que sincronizas tú, para una descripción o para comprobar qué dijo realmente una voz generada.
Más términos de voz