Saltar al contenido

[ Bitácora y pergaminos ]Migración desde Codea Bien

Blog

Lo que medí y lo que aprendí.

  • AI #model routing #costos de ai

    Model routing y costos: cuándo el modelo caro y cuándo el barato

    El camino más rápido para bajar la factura de AI no es negociar precios: es dejar de mandar todo al modelo caro. Clasificar un ticket, extraer un campo o resumir un texto no necesi…

    3 min // 150 xp

  • Angular #angular zoneless #zone.js eliminar

    Zoneless Angular: La guia definitiva

    Hace poco estuve probando con Angular v22 y me di cuenta de algo: si tu proyecto aun depende de Zone.js, estas dejando rendimiento sobre la mesa. En serio. Zoneless ya es el compor…

    5 min // 250 xp

  • AI #migrar a self-hosted #costo de llm

    El informe que dijo "no migren todavía"

    El PoC salió bien. El servidor levantaba, respondía, aguantaba 10 personas y costaba centavos al día. Y la recomendación que escribí fue: no migren todavía. No por miedo: por las c…

    3 min // 150 xp

  • AI #moe #mixture of experts

    MoE por dentro: 30B totales, 3B activos

    Un modelo de 30B que genera más rápido que uno de 7B. Suena a magia hasta que entiendes la arquitectura: no todos los parámetros se despiertan en cada token. En un modelo MoE (Mixt…

    2 min // 100 xp

  • AI #observabilidad agentes #trazas

    Observabilidad y trazas: "falló el modelo" casi nunca es el modelo

    Cuando un agente falla, el reflejo es culpar al modelo. Casi siempre el culpable es el harness: contexto que se recortó mal, una tool que devolvió un error silencioso, un timeout,…

    3 min // 150 xp

  • Angular #angular

    Angular 22.2: Mejoras que SI vas a usar

    Angular 22.2 fue lanzada 23 de septiembre con dos features grandes en developer preview, @boundary y router resources, más algunas cosas que sí cambian tu día a día. En este post v…

    9 min // 450 xp

  • AI #kv cache #vram

    48 KB por token: por qué 48 GB no aguantan 30 sesiones

    La pregunta era: ¿cuántas personas caben en una GPU de 48 GB? Y la respuesta no la decide la potencia de la tarjeta, ni los 30B del modelo, ni el batching. La decide una multiplica…

    3 min // 150 xp

  • AI #latencia de inferencia #ttft

    El cuello de botella no era la GPU: era la red

    Un usuario. Una pregunta. 2.541 ms hasta el primer token. Con una L40S de 48 GB delante. Si el modelo tarda decenas de milisegundos en responder, ¿dónde se fueron los dos segundos…

    3 min // 150 xp