Saltar al contenido
Guía8/8 capítulos

Mi primer servidor de inferencia propio

El PoC completo: que medi, que rompi y cuanto costo servir un modelo open-source en una GPU alquilada.

Guía: lista cerrada sobre un tema, de principio a fin.

Actualizado:

Progreso100%

Servir tu propio modelo dejó de ser un tema de laboratorio: hoy se alquila una GPU por menos de un dólar la hora y un modelo abierto de 30B cabe en 48 GB de VRAM. La pregunta ya no es si se puede, sino si te conviene.

Esta serie es el PoC completo que hicimos para responderla con números: dos ingenieros, una L40S alquilada, un modelo MoE de código y una regla — nada se decide sin medir. Ocho capítulos con el stack (opencode → LiteLLM → vLLM), el hardware y sus costos reales, los bugs que nos costaron horas, las mediciones de latencia y throughput, la matemática de la memoria y el informe final que —spoiler— recomendó no migrar todavía con las cuentas en la mano.

Vas a encontrar: setups que puedes copiar, los 7 bugs del entorno alquilado con síntoma, causa y fix, y números propios (TTFT, tokens/s, VRAM y costo) en lugar de benchmarks ajenos. Y también lo que no medimos: la calidad del modelo, la latencia en red privada y el comportamiento con 30 usuarios concurrentes. Esa honestidad es parte del valor: un PoC que dice "todavía no" te ahorra una decisión cara.

Empieza por el capítulo 1 (el plan) y sigue el orden: la serie está pensada como un recorrido, del "¿se puede?" al "¿y ahora qué?".

> Ver todas las guías y series