The real cost of your AI feature: API vs self-host vs edge
La pregunta no llega en el diseño: llega con la factura. "¿Cuánto cuesta cada usuario?" es la pregunta que separa un feature de un producto, y se responde con tres datos: tokens por petición, peticiones por mes y el precio real de la unidad.
Esta pieza es esa cuenta, con precios publicados y las trampas que se olvidan.
La unidad de cuenta: costo por 1M tokens
Los proveedores de API cobran por token, entrada y salida. Precios de lista por millón de tokens (MTok) del mismo proveedor, para ver el rango:
| Modelo | Entrada | Salida |
|---|---|---|
| Haiku 4.5 | $1 | $5 |
| Sonnet 5 | $2 | $10 |
| Opus 5.5 | $4 | $20 |
| Fable 5.1 | $10 | $50 |
Fuente: Pricing - Anthropic
Dos consecuencias directas:
- La salida cuesta más que la entrada (entre 4x y 5x en esta tabla). Un feature que genera mucho texto paga por eso.
- La elección de modelo multiplica la factura hasta 10x entre el más barato y el más caro. Rutear no es una optimización fina; es la diferencia entre rentable y no. → Servir varios modelos en producción
Los costos que no son tokens
Del mismo proveedor, hay cargos y descuentos que cambian el total:
- Prompt caching: leer de caché es mucho más barato que reprocesar. En esta tabla, la lectura de caché va de $0.10/MTok (Haiku 4.5) a $0.25/MTok (Fable 5.1); escribir a caché va de $1.25 a $12.50. Traducción: ordena los prompts con el prefijo estable primero y acierta la caché.
- Batch processing: 50% de descuento para trabajo asíncrono que se puede agrupar.
- Web search: $10 por 1.000 búsquedas (más los tokens).
- Code execution: $0.05 por hora por contenedor (con 50 horas gratis diarias).
- Managed agents: $0.08 por hora-sesión de runtime activo.
Fuente: Pricing - Anthropic
Ese último punto es tendencia: empiezan a cobrarse unidades de operación (hora-sesión, búsqueda, contenedor), no solo tokens. Presupuestar "solo tokens" se queda corto.
vs self-host: la aritmética
Alquilar GPU se paga por hora, no por token. En RunPod: A100 80 GB a $1.59/hora, L40S a $1.09/hora, H100 SXM a $3.49/hora. - Source: GPU Cloud Pricing - RunPod
Para comparar con el pago por token, convierte:
costo por 1M tokens = ($/hora) ÷ (tokens generados por hora) × 1.000.000
Ejemplo (cifras hipotéticas para el cálculo): si tu servidor genera 1.000 tokens/s sostenidos con batching, son 3,6M tokens/hora. Sobre una GPU de $1.59/hora, eso da ~$0.44 por millón de tokens — más barato que la mayoría de las APIs, pero solo si la GPU está ocupada. Al 10% de uso, el mismo token cuesta 10 veces más.
La conclusión que importa: self-host gana cuando hay volumen sostenido. Con uso intermitente, la API casi siempre es más barata porque no pagas el tiempo muerto. → ¿Qué hardware necesitas?
Los costos que se olvidan (siempre)
- Tiempo encendido sin tráfico (en GPU dedicada) o almacenamiento de modelos ($0.07–$0.14/GB/mes en RunPod).
- Tu tiempo de operación: cambiar versiones, monitorear, escalar.
- El costo de la calidad: un modelo barato que falla más te cuesta retrabajo y usuarios. Ese número no aparece en la factura, aparece en las evals.
La calculadora mental (5 pasos)
- Tokens por petición: entrada + salida, medido, no estimado.
- Peticiones por mes: tu tráfico real o proyectado con margen.
- Precio unitario: por MTok (API) o por hora (self-host) al día de hoy.
- Self-host solo si la GPU estaría ocupada de forma sostenida; si no, API.
- Repite el cálculo cada trimestre: los precios y los modelos cambian, y tu tráfico también.
Y una regla que me ahorra sustos: modela el peor mes, no el promedio. Un pico de tráfico con el modelo caro puede costar más que medio año de operación normal.
El desarrollo completo, en la guía Inference Engineering: de cero a producción. La decisión de qué modelo, en Elegir modelo en 2026.
¿Ya calculaste el costo por usuario de tu feature? Cuéntame en los comentarios qué te sorprendió de la cuenta.