Un descuento en los planes premium al registrarteConsigue tu descuento

blog/developers·5 ago 2026·5 min·por el equipo de eroq

Dar voz a personajes de IA: latencia, costo y oficio del TTS

Dónde encaja la voz en un producto de personajes, cómo contener el costo de síntesis y los detalles que hacen que una frase suene actuada, no leída.


El texto le da a un personaje una mente; la voz le da un cuerpo. La diferencia en retención es real: a un personaje que habla se le vuelve a abrir. Pero la voz también es la función más fácil de construir mal: cara, lenta y plana. Este es el manual que usamos.

La voz como momento, no como modalidad

El instinto es ponerle voz a todo. Resístelo. La síntesis cuesta dinero real por cada carácter de entrada (3 créditos por cada 100 caracteres con Voice One, 2 con Voice Turbo, que es más rápido), y un muro de audio que se reproduce solo cansa de todos modos.

La voz funciona como puntuación: el saludo cuando se abre una conversación, un momento emocional, una respuesta que el usuario pide escuchar de forma expresa. Los productos que tratan la voz como un momento premium gastan una décima parte y obtienen más retención, porque la escasez es lo que hace que funcione.

El modelo de costos

POST /v1/audio/speech cobra por cada bloque de 100 caracteres iniciado. Cifras prácticas:

Línea Caracteres Créditos ~Costo
Saludo corto 80 3 $0.03
Respuesta típica 240 9 $0.09
Momento dramático largo 600 18 $0.18

Dos implicaciones. Primero, escribe para la voz: una frase hablada debería ser más corta que una escrita de todos modos, y recortar a 200 caracteres es una mejora de oficio que reduce tu factura a la mitad. Segundo, cachea a fondo: los saludos, las coletillas y los momentos recurrentes son el mismo audio cada vez. Haz un hash de voice + text y guarda tú mismo el MP3 (cada línea también llega a tu Biblioteca, pero una caché propia es lo que hace que repetir no cueste nada), y una enorme parte de las reproducciones pasa a ser gratis.

La latencia y cómo se percibe

La síntesis tarda un segundo o dos. El truco es que la latencia percibida es una propiedad de la interfaz:

  • Muestra la respuesta de texto de inmediato; deja que el audio llegue detrás con un indicador discreto de «cargando voz». Los usuarios leen mientras se renderiza.
  • Para los momentos guionizados (onboarding, saludos), genera por adelantado: esas líneas se conocen antes de que llegue el usuario.
  • Nunca bloquees la conversación por el audio. Una voz que falla debería degradarse a texto en silencio, no convertir el turno en un error.

Que suene interpretado

La diferencia entre «leído en voz alta» e «interpretado» está sobre todo en el texto de entrada:

  • La puntuación es prosodia. Las comas, los guiones y los puntos suspensivos son la forma de dirigir el ritmo. «Bueno… eso sí es nuevo.» se interpreta; «Bueno eso es nuevo» se lee.
  • Mantén la voz del personaje en las palabras. La voz de síntesis aporta el timbre; la escritura aporta la personalidad. Un personaje sarcástico necesita frases sarcásticas, no un ajuste de voz sarcástico.
  • Asigna una voz a cada personaje una vez y no la cambies nunca. La identidad de la voz es la identidad del personaje: cambiar de voz a mitad de la relación es el equivalente sonoro de cambiar el avatar.

El catálogo (aria, cálida e íntima; orion, grave y sin prisas; consulta la referencia) es corto y seleccionado a propósito: dos voces que siempre suenan bien valen más que cuarenta que a veces lo hacen, y las dos leen 13 idiomas. Cuando ninguna encaja con el personaje, clona una voz a partir de tu propio audio y asígnale esa.

El viaje de vuelta: también oídos

El mismo pipeline de audio funciona en sentido contrario: /v1/audio/transcriptions (1 crédito por minuto de audio) convierte el mensaje de voz de un usuario en texto que tu personaje puede responder. Voz de entrada, razonamiento en texto y voz de salida: ese es el ciclo completo de un «modo llamada», y cada tramo es una sola llamada a la API.

Preguntas frecuentes

¿Cuánto cuesta por línea el texto a voz con IA?

Voice One cobra 3 créditos por cada bloque de 100 caracteres iniciado, y Voice Turbo 2, con el mismo catálogo y los mismos clones. Una respuesta de 240 caracteres son 9 créditos con Voice One, unos nueve centavos. Escribir líneas más cortas es a la vez una mejora de oficio y la forma más barata de reducir la factura a la mitad.

¿Puedo clonar la voz de un personaje?

Sí: sube tu propio audio en el estudio de Voz y el clon se une a tu catálogo, asignable desde la API igual que aria u orion. A un personaje se le asigna una voz clonada o del catálogo una sola vez, y así es como mantienes estable la identidad de la voz a lo largo de una relación.

¿Qué idiomas hablan las voces?

Los dos modelos de voz leen 13 idiomas, y una voz clonada también funciona en todos ellos. El idioma lo determina el texto que envías y no un parámetro aparte, así que un personaje puede responder en el idioma del usuario con el mismo timbre.

¿Puede eroq sincronizar los labios de una voz con un video o un avatar?

No. No hay sincronización labial, ni función de avatar parlante, ni voz en tiempo real: la síntesis devuelve un MP3 que reproduces tú. Diseña el momento como una nota de voz adjunta a una imagen fija, que es lo que funciona en producción de todos modos, y exporta a un editor de video si necesitas las dos cosas en una misma línea de tiempo.

Empieza por los saludos: una línea en caché por personaje, unos pocos créditos cada una, lista en una tarde. Mide qué efecto tiene en la retención del segundo día y luego decide hasta dónde quieres llevarlo. En nuestra experiencia, esa primera tarde es la que cambia el producto.

Etiquetasvoicettscharacters

Crea esto con los modelos detrás del artículo: empieza con 50 créditos gratis o explora todos los motores y sus precios.