Saltar al contenido
Guía8/8 capítulos

vLLM desde cero: tu primer servidor de inferencia

De cero a tu propio servidor vLLM en una GPU alquilada: 8 capítulos prácticos, por menos de $5 y con números medidos en cada paso.

Guía: lista cerrada sobre un tema, de principio a fin.

Actualizado:

Progreso100%

Una guía práctica para pasar de cero conocimiento de inferencia a tu propio servidor vLLM en una GPU alquilada: por menos de $5 y con números medidos en cada paso.

Qué vas a construir

  • Un modelo local corriendo en tu máquina con Ollama
  • Un servidor vLLM con un modelo de 30B en FP8 en una GPU de 48 GB
  • Un gateway con llaves por persona, presupuestos y logs
  • Tus propios benchmarks de TTFT, tokens/s y concurrencia

Son 8 capítulos, cada uno con comandos que corrieron en un pod real y un checkpoint de tiempo y costo. Empieza por el capítulo 1 y no saltes pasos: cada uno monta sobre el anterior.

> Ver todas las guías y series