Un descuento en los planes premium al registrarteConsigue tu descuento

eroq api · voz

Dale una voz.
Y de vuelta al texto.

Dos modelos de voz a dos o tres créditos por cada cien caracteres, voces de estudio seleccionadas y clonación a partir de una grabación limpia. Asigna una voz a un personaje y todo lo que diga sonará con esa voz; luego transcribe el audio de vuelta a texto con la misma clave.

Salida en MP3 · 13 idiomas · clones privados de tu cuenta

50 créditos gratis al registrarte · sin tarjeta

curl https://eroq.ai/v1/audio/speech \
  -H "Authorization: Bearer $EROQ_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "eroq-voice-one",
  "input": "That noise is the reactor missing its coolant flush. [sighing] Again.",
  "voice": "aria"
}' \
  --output speech.mp3

Qué obtienes

Voice para productos que llegan a producción.

Dos velocidades

Voice One a tres créditos por cada cien caracteres, Voice Turbo a dos. El mismo formato de solicitud y las mismas voces de estudio: Turbo sacrifica un poco de matiz a cambio de latencia y costo cuando la frase es una notificación y no una interpretación.

Clona una voz

Sube una grabación limpia y el clon es solo tuyo: privado de tu cuenta y utilizable desde la API, el estudio y cualquier personaje al que lo asignes. No se publica en ningún catálogo compartido y nadie más puede acceder a él.

Personajes que hablan

Vincula una voz a un personaje guardado y todo lo que diga saldrá con ella, ya venga la llamada de tu producto, de una película o del estudio. Una sola asignación en lugar de un id de voz repartido por cada llamada de tu código.

La dirección, en el texto

La velocidad y la expresividad son parámetros, y el resto de la interpretación va en el texto de entrada: la puntuación (comas, puntos suspensivos, saltos de línea) en ambos motores y, en Voice One, etiquetas entre corchetes como [whispering] o [laughing], que se interpretan y nunca se leen en voz alta. No hay ningún dialecto SSML que aprender ni con el que equivocarse.

Trece idiomas

Las mismas voces hablan trece idiomas, así que un narrador clonado puede leer textos que nunca se grabaron en ese idioma. La pronunciación sigue al texto, así que conviene escribir los números con letras y los nombres tal como se pronuncian.

Y de vuelta

La transcripción funciona con la misma clave a un crédito por minuto de audio, lo que cierra el círculo para subtitular tu propia narración. No hay diarización de hablantes ni marcas de tiempo por palabra, así que devuelve texto, no un archivo de subtítulos.

Preguntas frecuentes

La versión corta.

¿Cuánto cuesta generar voz? +

Tres créditos por cada cien caracteres en Voice One y dos en Voice Turbo, según el texto que envíes. La transcripción cuesta un crédito por cada minuto de audio iniciado.

¿Quién puede usar una voz que clono? +

Solo tu cuenta. Los clones son privados, no se añaden a ningún catálogo compartido y se pueden eliminar, lo que los quita de todos los personajes a los que estaban asignados.

¿En qué formato llega el audio? +

MP3. No hay endpoint de audio en streaming, así que un pasaje largo llega como un único archivo terminado y no a medida que se pronuncia.

¿Puede sincronizar los labios de una cara generada? +

No. La voz y el video son llamadas separadas y no hay herramienta de sincronización labial. Veo 3.1 puede generar una frase hablada como parte de un clip, pero no puedes poner una pista de voz sobre un clip existente y que la boca coincida.

¿La transcripción devuelve marcas de tiempo? +

No: devuelve texto. No hay diarización, ni tiempos por palabra, ni archivo de subtítulos, así que los subtítulos aún necesitan una pasada en tu programa de edición.

Tu primera llamada en cinco minutos.

Regístrate, crea una clave y pega el ejemplo de inicio rápido. Con 50 créditos gratis puedes probar todos los modelos, y los planes empiezan en $15.