Skip to content

[ Scrolls & chronicles ]Migration from Codea Bien

Blog

What I measured and what I learned.

  • AI #model routing #ai costs

    Model routing and costs: when to pay for the expensive model

    El camino más rápido para bajar la factura de AI no es negociar precios: es dejar de mandar todo al modelo caro. Clasificar un ticket, extraer un campo o resumir un texto no necesi…

    3 min // 150 xp

  • AI #migrating to self-hosted #llm cost

    The report that said "do not migrate yet"

    El PoC salió bien. El servidor levantaba, respondía, aguantaba 10 personas y costaba centavos al día. Y la recomendación que escribí fue: no migren todavía. No por miedo: por las c…

    3 min // 150 xp

  • AI #moe #mixture of experts

    Inside MoE: 30B total, 3B active

    Un modelo de 30B que genera más rápido que uno de 7B. Suena a magia hasta que entiendes la arquitectura: no todos los parámetros se despiertan en cada token. En un modelo MoE (Mixt…

    2 min // 100 xp

  • AI #agent observability #traces

    Observability and traces: "the model failed" is rarely the model

    Cuando un agente falla, el reflejo es culpar al modelo. Casi siempre el culpable es el harness: contexto que se recortó mal, una tool que devolvió un error silencioso, un timeout,…

    3 min // 150 xp

  • Angular #angular

    Angular 22.2: Mejoras que SI vas a usar

    Angular 22.2 fue lanzada 23 de septiembre con dos features grandes en developer preview, @boundary y router resources, más algunas cosas que sí cambian tu día a día. En este post v…

    9 min // 450 xp

  • AI #kv cache #vram

    48 KB per token: why 48 GB cannot hold 30 sessions

    La pregunta era: ¿cuántas personas caben en una GPU de 48 GB? Y la respuesta no la decide la potencia de la tarjeta, ni los 30B del modelo, ni el batching. La decide una multiplica…

    3 min // 150 xp

  • AI #inference latency #ttft

    The bottleneck was not the GPU: it was the network

    Un usuario. Una pregunta. 2.541 ms hasta el primer token. Con una L40S de 48 GB delante. Si el modelo tarda decenas de milisegundos en responder, ¿dónde se fueron los dos segundos…

    3 min // 150 xp