Un descuento en los planes premium al registrarteConsigue tu descuento

blog/guides·20 ago 2026·5 min·por el equipo de eroq

Autoalojar modelos sin censura o usar una API: las cuentas reales

Alquiler de GPU, tasa de uso y tiempo de operaciones: el punto de equilibrio real entre tu propio stack sin censura y créditos fijos por llamada.


«¿Por qué pagar por llamada si una 4090 alquilada cuesta $300 al mes?» es la objeción más razonable a una API de IA sin censura, y a veces tiene razón. Aquí van las cuentas reales, incluidas las partes que no caben en un tuit.

Las cuentas a precio de lista

Una GPU de consumo alquilada (clase 4090) cuesta aproximadamente $0.35–0.50 por hora: digamos $250–370 al mes encendida todo el tiempo. Una tarjeta clase A100 para modelos más grandes cuesta $1.10–1.80 por hora: $800–1,300 al mes. Un modelo de rol de 13B cuantizado en la 4090 aguanta el tráfico de chat de un producto real; uno de 70B pide la A100 o un equipo con varias GPU.

Frente a los créditos fijos (una respuesta cuesta 1–3 créditos ≈ 1–3¢, tabla completa), el punto de equilibrio ingenuo para el chat es:

Respuestas al mes Costo de la API (RP mini) Autoalojado (4090)
100,000 ~$830 ~$300 + operaciones
30,000 ~$250 ~$300 + operaciones
10,000 ~$83 ~$300 + operaciones

En algún punto en torno a las 30–40k respuestas al mes, la línea de la GPU cae por debajo de la de la API. ¿Caso cerrado a favor de autoalojar a escala? Solo si no te afecta nada de lo que viene en los cuatro apartados siguientes.

Lo que esconden las cuentas a precio de lista

La tasa de uso lo es todo. La GPU factura 24/7; tus usuarios llegan en picos por la noche. Los productos reales ven una utilización del 15–35%, lo que duplica o triplica tu costo efectivo por llamada. El precio fijo de la API es el batching de otro: pagas por resultados, no por silicio ocioso. Las generaciones fallidas incluso se reembolsan solas.

Las operaciones son un sueldo, no una nota al pie. Actualizaciones de modelos, la ruleta de los drivers de CUDA, caídas por falta de memoria (OOM) en tu pico del sábado, regresiones de cuantización tras cada actualización del fine-tune. Presupuesta horas reales de ingeniería al mes para un stack de inferencia en producción: a tarifa de freelance, eso ya es tu factura de la API antes de servir un solo token.

El ajuste es el costo invisible. Los checkpoints sin censura en bruto se repiten, se desvían y rompen la cuarta pared bajo la presión del rol: los modos de fallo son muy concretos y corregirlos (perfiles de muestreo, antirrepetición, control del registro) es justo el trabajo que esperabas ahorrarte.

El chat era la modalidad fácil. En cuanto tu producto quiere imágenes, video, voz o transcripción, el autoalojamiento se multiplica: modelos separados, VRAM separada, pipelines separados, más almacenamiento y una CDN para los resultados. Una sola clave de API que cubra los diez frentes es el argumento que suele zanjar el debate en los equipos pequeños.

Cuándo gana de verdad el autoalojamiento

Siendo honestos, autoalojar es la decisión correcta cuando se cumplen las cuatro condiciones:

  1. Volumen estable, alto y predecible (≥50k respuestas al mes, sin grandes picos nocturnos seguidos de caídas en picado);
  2. Una modalidad, un modelo que ya has validado;
  3. Un ingeniero que quiere hacerse cargo de la inferencia (los requisitos de localización de datos o de cumplimiento normativo cuentan doble);
  4. Tolerancia a un fin de semana caído mientras algo se recompila.

Es un perfil real: algunos de los mejores productos del sector funcionan así. Simplemente no es el caso de la mayoría, y casi nunca el de los productos que están empezando, cuando la velocidad de iteración vale más que el margen.

Si lo que te empuja hacia tu propia GPU es la privacidad, lee las condiciones de retención del proveedor antes que los presupuestos de GPU. Aquí, los modelos propios de eroq (RP+ y RP mini incluidos) no retienen nada en el proveedor, y el modo privado (un interruptor en el estudio, o private: true en los endpoints de imagen y video) no guarda ningún archivo ni entrada en la biblioteca y sustituye el prompt por asteriscos en el registro de uso. Fuera del modo privado, los prompts se conservan en el registro de uso para la facturación y la gestión de abusos; si tus requisitos de cumplimiento descartan incluso eso, estás en la condición 3 de arriba, y autoalojar es la respuesta honesta.

El modelo híbrido que sí funciona

El patrón que vemos funcionar: prototipa y lanza con la API (una clave, 50 créditos gratis, una guía de inicio rápido de cinco minutos), mide tu tráfico real y rehaz las cuentas con tu volumen auténtico: con precios públicos fijos, la columna de la API en la hoja de cálculo es cosa de cinco minutos. Si solo el volumen de chat cruza la línea, pasa esa carga de trabajo a tu propia GPU y deja imágenes, video y voz en la API. Que la API no tenga estado hace que el cambio sea aburrido: es una URL base por carga de trabajo.

Preguntas frecuentes

¿Autoalojar un modelo sin censura es más barato que una API?

Con volumen, y solo para chat, al final sí: el cruce ingenuo está en torno a 30–40k respuestas al mes frente a llamadas de RP mini a 1 créditos. Luego aplica las correcciones: una utilización real del 15–35% duplica o triplica tu costo efectivo por llamada, y el tiempo de operaciones es una partida de sueldo. Los productos que modelan esas dos cosas con honestidad suelen encontrar el cruce mucho más lejos de lo que sugieren las cuentas a precio de lista.

¿Qué GPU necesito para ejecutar un modelo de rol sin censura?

Un 13B cuantizado en una tarjeta clase 4090 aguanta el tráfico de chat de un producto real por unos $250–370 al mes encendida todo el tiempo. Un 70B pide una tarjeta clase A100 o un equipo con varias GPU, en el rango de $800–1,300. Son precios de alquiler de septiembre de 2026: comprueba las tarifas actuales antes de montar una hoja de cálculo sobre ellos.

¿Cuánto cuesta eroq con 100,000 respuestas al mes?

100,000 créditos en RP mini, unos $833 con la tarifa del paquete de $100 por 12,000 créditos, o aproximadamente $1,000 con el paquete de entrada. Los créditos del plan se acumulan para siempre, así que una suscripción que se pasa un mes no se desperdicia: se ahorra.

¿Puedo usar ambos y mover cargas de trabajo más adelante?

Sí, y es el patrón que suele funcionar. Prototipa con la API, mide tu tráfico real y luego pasa a tu propia GPU solo la carga de trabajo que cruza la línea (casi siempre el chat), mientras imágenes, video, voz y transcripción se quedan en una sola clave. La API no tiene estado, así que el cambio es una URL base por carga de trabajo, no una migración.

Las decisiones de infraestructura merecen cifras, no corazonadas: calcula las dos columnas con tus propios números.

Etiquetasself-hostingcostsinfrastructure

Crea esto con los modelos detrás del artículo: empieza con 50 créditos gratis o explora todos los motores y sus precios.