[ Bitácora y pergaminos ]Migración desde Codea Bien
Blog
Lo que rompí, lo que medí y lo que aprendí.
- OCT 2026AI #vllm #servir modelos de ia
Qué es servir un modelo de IA (y por qué existe vLLM)
Servir un modelo de IA es convertir un archivo de pesos en una API que responde preguntas. Ese es el oficio completo de un inference engineer, y esta guía te lleva de cero a tu pro…
5 min // 250 xp
- OCT 2026AI #ollama #modelo local
Tu primer modelo local en 10 minutos (Ollama)
Antes de alquilar una sola GPU, vamos a correr un modelo en tu propia máquina. Gratis, sin cuenta, en 10 minutos. El objetivo no es producción: es que entiendas el ciclo completo d…
4 min // 200 xp
- OCT 2026AI #runpod #alquilar gpu
Alquila tu primera GPU sin miedo (~$1 la hora)
Llegó la hora del hardware de verdad. Vamos a alquilar una GPU de 48 GB, correr nuestros primeros comandos y apagarla sin dejar dinero tirado. Presupuesto total del capítulo: ~$3.…
3 min // 150 xp
- OCT 2026AI #vllm flags #gpu-memory-utilization
Los 5 flags de vLLM que importan de verdad
vLLM tiene más de cien flags de configuración. Cinco deciden cuánto contexto aguantas, cuánto gastas y si tu agente funciona. Los demás son tuning fino para cuando ya mides. Este c…
4 min // 200 xp
- OCT 2026AI #vllm serve #primer servidor vllm
Tu primer servidor vLLM (hello world)
El pod ya corre. Ahora lo importante: instalar vLLM, descargar un modelo de 30B y encender tu primer servidor de inferencia en internet. Son 20 minutos de trabajo real; el resto es…
3 min // 150 xp
- OCT 2026AI #vllm troubleshooting #errores gpu alquilada
Cuando explota: los 7 errores de servir vLLM en GPU alquilada
Tu servidor va a fallar. No es pesimismo, es estadística: alquilaste un contenedor efímero, descargaste 31 GB de pesos y levantaste tres servicios que se conocieron hoy. La diferen…
4 min // 200 xp
- OCT 2026AI #medir vllm #benchmark ttft
Mide tu vLLM: TTFT, tokens/s y concurrencia sin engañarte
Un servidor que "funciona" no dice nada. La pregunta de un engineer es cuánto: cuánto tarda el primer token, cuántos tokens por segundo, cuántas personas a la vez. Este capítulo te…
4 min // 200 xp
- OCT 2026AI #litellm gateway #virtual keys
LiteLLM: llaves, presupuestos y la factura de tu vLLM
Tu vLLM está en internet con una sola API key compartida. Eso está bien para ti solo. Para un equipo es un desastre: nadie sabe quién gasta qué, y quitarle el acceso a alguien sign…
5 min // 250 xp
- OCT 2026AI #antigravity sdk #gemma 4
Antigravity SDK con modelos locales: tu GPU, tus tokens, cero nube
Un domingo a las 00:14 mi pipeline de contenido se quedó sin cuota. No fue un bug. La API me devolvió un 429 a mitad del batch y el job murió dejando 18 posts a medio generar. Me q…
9 min // 450 xp
- OCT 2026AI #stitch cli #google stitch
Stitch CLI: Google trae el diseño de UI a la terminal (y a tu agente)
Google presentó Stitch CLI, una herramienta de línea de comandos (@google/stitch) que lleva el diseño de UI generativo de Stitch a la terminal y a tu agente de código. La promesa o…
11 min // 550 xp