eroq api · voz
Dale una voz.
Y de vuelta al texto.
Dos modelos de voz a dos o tres créditos por cada cien caracteres, voces de estudio seleccionadas y clonación a partir de una grabación limpia. Asigna una voz a un personaje y todo lo que diga sonará con esa voz; luego transcribe el audio de vuelta a texto con la misma clave.
Salida en MP3 · 13 idiomas · clones privados de tu cuenta
50 créditos gratis al registrarte · sin tarjeta
curl https://eroq.ai/v1/audio/speech \
-H "Authorization: Bearer $EROQ_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "eroq-voice-one",
"input": "That noise is the reactor missing its coolant flush. [sighing] Again.",
"voice": "aria"
}' \
--output speech.mp3Los modelos
3 modelos. Precios fijos.
Voice One
speecheroq-voice-one
Síntesis de voz natural con una selección de voces de estudio. Devuelve audio MP3 directamente.
3 créditos / 100 caracteres
Voice Turbo
speecheroq-voice-turbo
El nivel de voz para alto volumen: menos latencia y menor precio, con las mismas voces de estudio y las mismas voces clonadas que Voice One.
2 créditos / 100 caracteres
Scribe One
transcriptioneroq-scribe-one
Transcripción con detección automática del idioma, pensada para audios de la duración de un mensaje de voz.
1 crédito / minuto
Qué obtienes
Voice para productos que llegan a producción.
Dos velocidades
Voice One a tres créditos por cada cien caracteres, Voice Turbo a dos. El mismo formato de solicitud y las mismas voces de estudio: Turbo sacrifica un poco de matiz a cambio de latencia y costo cuando la frase es una notificación y no una interpretación.
Clona una voz
Sube una grabación limpia y el clon es solo tuyo: privado de tu cuenta y utilizable desde la API, el estudio y cualquier personaje al que lo asignes. No se publica en ningún catálogo compartido y nadie más puede acceder a él.
Personajes que hablan
Vincula una voz a un personaje guardado y todo lo que diga saldrá con ella, ya venga la llamada de tu producto, de una película o del estudio. Una sola asignación en lugar de un id de voz repartido por cada llamada de tu código.
La dirección, en el texto
La velocidad y la expresividad son parámetros, y el resto de la interpretación va en el texto de entrada: la puntuación (comas, puntos suspensivos, saltos de línea) en ambos motores y, en Voice One, etiquetas entre corchetes como [whispering] o [laughing], que se interpretan y nunca se leen en voz alta. No hay ningún dialecto SSML que aprender ni con el que equivocarse.
Trece idiomas
Las mismas voces hablan trece idiomas, así que un narrador clonado puede leer textos que nunca se grabaron en ese idioma. La pronunciación sigue al texto, así que conviene escribir los números con letras y los nombres tal como se pronuncian.
Y de vuelta
La transcripción funciona con la misma clave a un crédito por minuto de audio, lo que cierra el círculo para subtitular tu propia narración. No hay diarización de hablantes ni marcas de tiempo por palabra, así que devuelve texto, no un archivo de subtítulos.
En la referencia
Sigue leyendo
Preguntas frecuentes
La versión corta.
¿Cuánto cuesta generar voz? +
Tres créditos por cada cien caracteres en Voice One y dos en Voice Turbo, según el texto que envíes. La transcripción cuesta un crédito por cada minuto de audio iniciado.
¿Quién puede usar una voz que clono? +
Solo tu cuenta. Los clones son privados, no se añaden a ningún catálogo compartido y se pueden eliminar, lo que los quita de todos los personajes a los que estaban asignados.
¿En qué formato llega el audio? +
MP3. No hay endpoint de audio en streaming, así que un pasaje largo llega como un único archivo terminado y no a medida que se pronuncia.
¿Puede sincronizar los labios de una cara generada? +
No. La voz y el video son llamadas separadas y no hay herramienta de sincronización labial. Veo 3.1 puede generar una frase hablada como parte de un clip, pero no puedes poner una pista de voz sobre un clip existente y que la boca coincida.
¿La transcripción devuelve marcas de tiempo? +
No: devuelve texto. No hay diarización, ni tiempos por palabra, ni archivo de subtítulos, así que los subtítulos aún necesitan una pasada en tu programa de edición.
Tu primera llamada en cinco minutos.
Regístrate, crea una clave y pega el ejemplo de inicio rápido. Con 50 créditos gratis puedes probar todos los modelos, y los planes empiezan en $15.