Saltar al contenido

[ Bitácora y pergaminos ]Migración desde Codea Bien

Blog

Lo que medí y lo que aprendí.

  • AI #prefix caching #kv cache

    Prefix caching: la misma carga, 3× más rápido

    16,1 segundos a 5,2. El mismo modelo, la misma GPU, las mismas 10 peticiones al mismo contexto. Lo único que cambió: si el prefijo ya estaba en caché. Si sirves un agente, esto es…

    3 min // 150 xp

  • AI #benchmark llm #error de medición

    El error de mi propio benchmark

    Publicamos el primer barrido de concurrencia y los números eran demasiado buenos: 10 usuarios simultáneos, todos rápidos, sin un solo fallo. Antes de celebrar, revisamos una cosa:…

    3 min // 150 xp

  • AI #servir varios modelos #model routing

    Servir varios modelos en producción: routing, versionado y canary

    Tu app no necesita el modelo más caro para el 80% de las peticiones. Pero tampoco puedes hardcodear un modelo en cada archivo y esperar poder cambiarlo cuando salga uno mejor. La c…

    3 min // 150 xp

  • AI #fine-tuning #rag

    Fine-tuning vs RAG vs prompting: cuándo cada uno

    Cada pocas semanas alguien me dice que va a hacer fine-tuning. Casi nunca es lo que necesita: el 90% de los problemas que se atribuyen a "el modelo no sabe" se resuelven con mejor…

    3 min // 150 xp

  • AI #vllm producción #entorno alquilado

    Los 7 bugs del entorno alquilado

    El primer intento de levantar el servidor falló tres veces seguidas, por tres causas distintas, ninguna relacionada con el modelo. Al final de la semana teníamos una lista de siete…

    3 min // 150 xp

  • AI #servir un modelo propio #vllm

    Plan: servir mi propio modelo para bajar la factura

    La factura de los asistentes de código crecía con el equipo, y la pregunta era simple: ¿se puede servir un modelo open-source nosotros mismos y pagar menos? La respuesta honesta es…

    3 min // 150 xp

  • AI #rag #chunking

    RAG que funciona: chunking, reranking y hybrid search

    "Mi RAG no funciona" casi nunca significa "mi modelo es malo". Significa que el fragmento correcto no llegó al contexto: se cortó mal, se rankeó mal o no se encontró. El 80% de la…

    4 min // 200 xp

  • Supabase #supabase rls #row level security

    RLS: Seguridad real en tu base de datos

    Estás en una code review. Alguien abre la consola del navegador, lanza un fetch con la anon key y el room queda en silencio: la seguridad del proyecto entera dependía del código de…

    5 min // 250 xp

  • Supabase #supabase storage #file upload

    Storage: Upload, transformación y delivery de archivos

    Pregunta rápida: ¿cuánto tiempo de tu vida has perdido peleando con buckets, CORS, URLs firmadas y workers de imágenes? Si al leerlo te volvió un mal recuerdo, sigue leyendo.

    4 min // 200 xp

  • Supabase #supabase realtime #websockets

    Realtime: Apps que se actualizan solas

    20 líneas. Eso costó el chat en tiempo real. Sin WebSockets custom, sin Redis, sin un servidor intermedio que mantener a las 3 de la mañana.

    4 min // 200 xp