Qué es servir un modelo de IA (y por qué existe vLLM)
Capítulo 01 // 5 min
De cero a tu propio servidor vLLM en una GPU alquilada: 8 capítulos prácticos, por menos de $5 y con números medidos en cada paso.
Guía: lista cerrada sobre un tema, de principio a fin.
Actualizado:
Una guía práctica para pasar de cero conocimiento de inferencia a tu propio servidor vLLM en una GPU alquilada: por menos de $5 y con números medidos en cada paso.
Son 8 capítulos, cada uno con comandos que corrieron en un pod real y un checkpoint de tiempo y costo. Empieza por el capítulo 1 y no saltes pasos: cada uno monta sobre el anterior.
Capítulo 01 // 5 min
Capítulo 02 // 4 min
Capítulo 03 // 3 min
Capítulo 04 // 3 min
Capítulo 05 // 4 min
Capítulo 06 // 4 min
Capítulo 07 // 5 min
Capítulo 08 // 4 min