Skip to content

[ Scrolls & chronicles ]Migration from Codea Bien

Blog

What I measured and what I learned.

  • AI #prefix caching #kv cache

    Prefix caching: same load, 3x faster

    16,1 segundos a 5,2. El mismo modelo, la misma GPU, las mismas 10 peticiones al mismo contexto. Lo único que cambió: si el prefijo ya estaba en caché. Si sirves un agente, esto es…

    3 min // 150 xp

  • AI #llm benchmark #measurement error

    The error in my own benchmark

    Publicamos el primer barrido de concurrencia y los números eran demasiado buenos: 10 usuarios simultáneos, todos rápidos, sin un solo fallo. Antes de celebrar, revisamos una cosa:…

    3 min // 150 xp

  • AI #serving multiple models #model routing

    Serving multiple models in production: routing, versioning and canary

    Tu app no necesita el modelo más caro para el 80% de las peticiones. Pero tampoco puedes hardcodear un modelo en cada archivo y esperar poder cambiarlo cuando salga uno mejor. La c…

    3 min // 150 xp

  • AI #fine-tuning #rag

    Fine-tuning vs RAG vs prompting: when to use each

    Cada pocas semanas alguien me dice que va a hacer fine-tuning. Casi nunca es lo que necesita: el 90% de los problemas que se atribuyen a "el modelo no sabe" se resuelven con mejor…

    3 min // 150 xp

  • AI #vllm in production #rented environment

    The 7 bugs of a rented GPU environment

    El primer intento de levantar el servidor falló tres veces seguidas, por tres causas distintas, ninguna relacionada con el modelo. Al final de la semana teníamos una lista de siete…

    3 min // 150 xp

  • AI #self-hosted model #vllm

    Plan: serving my own model to cut the bill

    La factura de los asistentes de código crecía con el equipo, y la pregunta era simple: ¿se puede servir un modelo open-source nosotros mismos y pagar menos? La respuesta honesta es…

    3 min // 150 xp

  • AI #rag #chunking

    RAG that works: chunking, reranking and hybrid search

    "Mi RAG no funciona" casi nunca significa "mi modelo es malo". Significa que el fragmento correcto no llegó al contexto: se cortó mal, se rankeó mal o no se encontró. El 80% de la…

    4 min // 200 xp

  • Supabase #supabase rls #row level security

    RLS: Real Security in Your Database

    You're in a code review. Someone opens the browser console, runs a fetch with the anon key, and the room goes silent: the project's security depended entirely on client code, and a…

    5 min // 250 xp

  • Supabase #supabase storage #file upload

    Storage: Upload, Transform and Deliver Files

    Quick question: how much of your life have you lost fighting buckets, CORS, signed URLs, and image workers? If just reading that brought back a bad memory, keep reading.

    4 min // 200 xp

  • Supabase #supabase realtime #websockets

    Realtime: Apps That Update Themselves

    20 lines. That's what the real-time chat cost. No custom WebSockets, no Redis, no middleware server to babysit at 3 AM.

    4 min // 200 xp