Saltar al contenido

[ Bitácora y pergaminos ]Migración desde Codea Bien

Blog

Lo que rompí, lo que medí y lo que aprendí.

  • AI #vllm #servir modelos de ia

    Qué es servir un modelo de IA (y por qué existe vLLM)

    Servir un modelo de IA es convertir un archivo de pesos en una API que responde preguntas. Ese es el oficio completo de un inference engineer, y esta guía te lleva de cero a tu pro…

    5 min // 250 xp

  • AI #ollama #modelo local

    Tu primer modelo local en 10 minutos (Ollama)

    Antes de alquilar una sola GPU, vamos a correr un modelo en tu propia máquina. Gratis, sin cuenta, en 10 minutos. El objetivo no es producción: es que entiendas el ciclo completo d…

    4 min // 200 xp

  • AI #runpod #alquilar gpu

    Alquila tu primera GPU sin miedo (~$1 la hora)

    Llegó la hora del hardware de verdad. Vamos a alquilar una GPU de 48 GB, correr nuestros primeros comandos y apagarla sin dejar dinero tirado. Presupuesto total del capítulo: ~$3.…

    3 min // 150 xp

  • AI #vllm flags #gpu-memory-utilization

    Los 5 flags de vLLM que importan de verdad

    vLLM tiene más de cien flags de configuración. Cinco deciden cuánto contexto aguantas, cuánto gastas y si tu agente funciona. Los demás son tuning fino para cuando ya mides. Este c…

    4 min // 200 xp

  • AI #vllm serve #primer servidor vllm

    Tu primer servidor vLLM (hello world)

    El pod ya corre. Ahora lo importante: instalar vLLM, descargar un modelo de 30B y encender tu primer servidor de inferencia en internet. Son 20 minutos de trabajo real; el resto es…

    3 min // 150 xp

  • AI #vllm troubleshooting #errores gpu alquilada

    Cuando explota: los 7 errores de servir vLLM en GPU alquilada

    Tu servidor va a fallar. No es pesimismo, es estadística: alquilaste un contenedor efímero, descargaste 31 GB de pesos y levantaste tres servicios que se conocieron hoy. La diferen…

    4 min // 200 xp

  • AI #medir vllm #benchmark ttft

    Mide tu vLLM: TTFT, tokens/s y concurrencia sin engañarte

    Un servidor que "funciona" no dice nada. La pregunta de un engineer es cuánto: cuánto tarda el primer token, cuántos tokens por segundo, cuántas personas a la vez. Este capítulo te…

    4 min // 200 xp

  • AI #litellm gateway #virtual keys

    LiteLLM: llaves, presupuestos y la factura de tu vLLM

    Tu vLLM está en internet con una sola API key compartida. Eso está bien para ti solo. Para un equipo es un desastre: nadie sabe quién gasta qué, y quitarle el acceso a alguien sign…

    5 min // 250 xp

  • AI #antigravity sdk #gemma 4

    Antigravity SDK con modelos locales: tu GPU, tus tokens, cero nube

    Un domingo a las 00:14 mi pipeline de contenido se quedó sin cuota. No fue un bug. La API me devolvió un 429 a mitad del batch y el job murió dejando 18 posts a medio generar. Me q…

    9 min // 450 xp