Skip to content

[ Scrolls & chronicles ]Category: AI // 52 posts

Blog

Articles about AI written from first-hand experience by Kevin Davila, Google Developer Expert.

  • AI #vllm #servir modelos de ia

    What Serving an AI Model Actually Means (and Why vLLM Exists)

    Serving an AI model means turning a file of weights into an API that answers questions. That's the whole job of an inference engineer, and this guide takes you from zero to your ow…

    5 min // 250 xp

  • AI #ollama #modelo local

    Your First Local Model in 10 Minutes (Ollama)

    Before renting a single GPU, let's run a model on your own machine. Free, no account, 10 minutes. The goal isn't production: it's understanding the full request-to-tokens cycle, wh…

    4 min // 200 xp

  • AI #runpod #alquilar gpu

    Rent Your First GPU Without Fear (~$1 per hour)

    It's time for real hardware. We'll rent a 48 GB GPU, run our first commands, and shut it down without leaving money behind. Total chapter budget: ~$3. You buy nothing.

    3 min // 150 xp

  • AI #vllm flags #gpu-memory-utilization

    The 5 vLLM Flags That Actually Matter

    vLLM has over a hundred configuration flags. Five decide how much context you hold, how much you spend, and whether your agent works. The rest is fine tuning for when you already m…

    4 min // 200 xp

  • AI #vllm serve #primer servidor vllm

    Your First vLLM Server (hello world)

    The pod is running. Now the important part: install vLLM, download a 30B model, and turn on your first inference server on the internet. It's 20 minutes of real work; the rest is d…

    3 min // 150 xp

  • AI #vllm troubleshooting #errores gpu alquilada

    When It Explodes: The 7 Errors of Serving vLLM on a Rented GPU

    Your server will fail. That's not pessimism, it's statistics: you rented an ephemeral container, downloaded 31 GB of weights, and started three services that met each other today.…

    4 min // 200 xp

  • AI #litellm gateway #virtual keys

    LiteLLM: Keys, Budgets and Your vLLM's Bill

    Your vLLM is on the internet with a single shared API key. That's fine for you alone. For a team it's a mess: nobody knows who spends what, and revoking someone's access means chan…

    4 min // 200 xp

  • AI #model routing #ai costs

    Model routing and costs: when to pay for the expensive model

    El camino más rápido para bajar la factura de AI no es negociar precios: es dejar de mandar todo al modelo caro. Clasificar un ticket, extraer un campo o resumir un texto no necesi…

    3 min // 150 xp

  • AI #migrating to self-hosted #llm cost

    The report that said "do not migrate yet"

    El PoC salió bien. El servidor levantaba, respondía, aguantaba 10 personas y costaba centavos al día. Y la recomendación que escribí fue: no migren todavía. No por miedo: por las c…

    3 min // 150 xp

  • AI #moe #mixture of experts

    Inside MoE: 30B total, 3B active

    Un modelo de 30B que genera más rápido que uno de 7B. Suena a magia hasta que entiendes la arquitectura: no todos los parámetros se despiertan en cada token. En un modelo MoE (Mixt…

    2 min // 100 xp

  • AI #agent observability #traces

    Observability and traces: "the model failed" is rarely the model

    Cuando un agente falla, el reflejo es culpar al modelo. Casi siempre el culpable es el harness: contexto que se recortó mal, una tool que devolvió un error silencioso, un timeout,…

    3 min // 150 xp

  • AI #kv cache #vram

    48 KB per token: why 48 GB cannot hold 30 sessions

    La pregunta era: ¿cuántas personas caben en una GPU de 48 GB? Y la respuesta no la decide la potencia de la tarjeta, ni los 30B del modelo, ni el batching. La decide una multiplica…

    3 min // 150 xp

  • AI #inference latency #ttft

    The bottleneck was not the GPU: it was the network

    Un usuario. Una pregunta. 2.541 ms hasta el primer token. Con una L40S de 48 GB delante. Si el modelo tarda decenas de milisegundos en responder, ¿dónde se fueron los dos segundos…

    3 min // 150 xp

  • AI #prefix caching #kv cache

    Prefix caching: same load, 3x faster

    16,1 segundos a 5,2. El mismo modelo, la misma GPU, las mismas 10 peticiones al mismo contexto. Lo único que cambió: si el prefijo ya estaba en caché. Si sirves un agente, esto es…

    3 min // 150 xp

  • AI #llm benchmark #measurement error

    The error in my own benchmark

    Publicamos el primer barrido de concurrencia y los números eran demasiado buenos: 10 usuarios simultáneos, todos rápidos, sin un solo fallo. Antes de celebrar, revisamos una cosa:…

    3 min // 150 xp

  • AI #serving multiple models #model routing

    Serving multiple models in production: routing, versioning and canary

    Tu app no necesita el modelo más caro para el 80% de las peticiones. Pero tampoco puedes hardcodear un modelo en cada archivo y esperar poder cambiarlo cuando salga uno mejor. La c…

    3 min // 150 xp

  • AI #fine-tuning #rag

    Fine-tuning vs RAG vs prompting: when to use each

    Cada pocas semanas alguien me dice que va a hacer fine-tuning. Casi nunca es lo que necesita: el 90% de los problemas que se atribuyen a "el modelo no sabe" se resuelven con mejor…

    3 min // 150 xp

  • AI #vllm in production #rented environment

    The 7 bugs of a rented GPU environment

    El primer intento de levantar el servidor falló tres veces seguidas, por tres causas distintas, ninguna relacionada con el modelo. Al final de la semana teníamos una lista de siete…

    3 min // 150 xp

  • AI #self-hosted model #vllm

    Plan: serving my own model to cut the bill

    La factura de los asistentes de código crecía con el equipo, y la pregunta era simple: ¿se puede servir un modelo open-source nosotros mismos y pagar menos? La respuesta honesta es…

    3 min // 150 xp

  • AI #rag #chunking

    RAG that works: chunking, reranking and hybrid search

    "Mi RAG no funciona" casi nunca significa "mi modelo es malo". Significa que el fragmento correcto no llegó al contexto: se cortó mal, se rankeó mal o no se encontró. El 80% de la…

    4 min // 200 xp

  • AI #agent skills #skill.md

    The skills that survived: anatomy of a skill that works

    Instalé skills de más. Al principio todas parecían útiles y al cabo de un mes casi ninguna se disparaba. Lo que me hizo reaccionar fue un dato ajeno: cuando un catálogo conocido de…

    3 min // 150 xp

  • AI #ai cost #price per million tokens

    The real cost of your AI feature: API vs self-host vs edge

    La pregunta no llega en el diseño: llega con la factura. "¿Cuánto cuesta cada usuario?" es la pregunta que separa un feature de un producto, y se responde con tres datos: tokens po…

    3 min // 150 xp

  • AI #llm serving #continuous batching

    Serving in production: batching, concurrency and autoscaling

    Mi servidor respondía perfecto con un usuario y se arrastraba con diez. La culpa no era del modelo ni de la GPU: era que atendía las peticiones de a una. El mismo modelo, la misma…

    3 min // 150 xp

  • AI #gpu for llm #vram needed

    What hardware do you need? GPU, VRAM and cloud

    "¿Compro una GPU o alquilo?" es la pregunta equivocada. La correcta es: ¿cuántas horas al mes la voy a usar? Todo lo demás (modelo, VRAM, precio) se deriva de esa cifra y de una cu…

    3 min // 150 xp

  • AI #quantization #4-bit

    Quantization with numbers: quality vs VRAM vs speed

    Un modelo que pesa 40 GB corriendo en una GPU de 16 GB. Eso no es un truco de marketing: es cuantización, y en un experimento documentado por Hugging Face fue exactamente el result…

    3 min // 150 xp

  • AI #local inference #lm studio

    Local inference in 2026: from LM Studio to vLLM (with VRAM math)

    Instalé LM Studio un sábado por curiosidad. Dos horas después tenía un modelo corriendo en mi máquina y una pregunta nueva: si esto es tan fácil, ¿por qué la gente habla de VRAM co…

    3 min // 150 xp

  • AI #codebase for agents #deep modules

    Design your repo so agents work better

    Tu codebase influye más en el resultado del agente que tu prompt o tu AGENTS.md. Y eso es una buena noticia: es lo único de la lista que puedes diseñar en lugar de redactar mejor.

    3 min // 150 xp

  • AI #structured outputs #valid json

    Structured outputs without suffering: JSON that doesn't break

    En la demo el JSON sale bien. En producción, cuando el input es raro o la respuesta se alarga, sale casi bien. Y "casi" es un bug: un campo que falta a las 3 de la mañana es una pá…

    4 min // 200 xp

  • AI #ai workflow #web development with agents

    My complete AI web development workflow: from issue to deploy

    El error de mis primeros meses con agentes fue pedir código. "Hazme esta feature" y esperar magia. El resultado era predecible: código que funcionaba a medias, revisiones eternas y…

    3 min // 150 xp

  • AI #mcp server #model context protocol

    Build your MCP server (and its footguns)

    Mi servidor MCP funcionaba perfecto en local. Agregué un console.log para depurar una respuesta rara, y el cliente dejó de responder. Sin error, sin mensaje: dejó de funcionar. Pas…

    4 min // 200 xp

  • AI #vercel ai sdk #toolloopagent

    Agents with Vercel AI SDK 7: ToolLoopAgent and HarnessAgent

    Veinte líneas. Un agente con tools, loop y condición de parada, sin escribir el ciclo a mano. Eso es lo que te da ToolLoopAgent del AI SDK, y es la razón por la que hoy es mi punto…

    4 min // 200 xp

  • AI #google adk #adk 2.0

    Agents with ADK 2.0: when a framework saves you months

    Cuando escribí mi primer agente "puro" con archivos markdown, entendí el harness. Cuando intenté ponerlo en producción, entendí para qué sirve un framework: sesiones, evaluación, t…

    3 min // 150 xp

  • AI #markdown agent #agents.md

    Your first "pure" agent: markdown files only

    Sin SDK, sin framework, sin servidor. Cuatro archivos de texto y un agente que funciona. Suena a truco, pero es la forma más rápida de entender qué es un agente de verdad: si no pu…

    4 min // 200 xp

  • AI #evals #evaluating agents

    Evals: the 3 types, and how to know if your agent improved

    Durante semanas creí que mi agente mejoraba. Cambiaba el prompt, probaba dos o tres casos, quedaba convencido y lo dejaba así. Hasta que un día noté que había empeorado en lo que a…

    4 min // 200 xp

  • AI #harness engineering #agent

    Harness Engineering: the 9 pieces, built and measured

    Llevaba meses intentando explicar por qué dos equipos con el mismo modelo obtienen resultados opuestos. El marco que me faltaba: no compites por el modelo, compites por el harness.…

    4 min // 200 xp

  • AI #what is an agent #agent loop

    What An Agent Really Is: Model + Harness

    La primera vez que construí un "agente" era un prompt de 800 palabras con instrucciones numeradas. Funcionó sorprendentemente bien durante dos semanas. Después empezó a fallar: olv…

    5 min // 250 xp

  • AI #ai engineer #what is an ai engineer

    What Is An AI Engineer (And My Path From Frontend)

    Mi perfil dice Frontend Engineer. La semana pasada pasé tres horas midiendo VRAM, comparando cuantizaciones y peleándome con el max-model-len de un servidor de inferencia. No hubo…

    4 min // 200 xp

  • AI #ai dictionary #ai engineering

    AI Dictionary: 36 terms to understand AI Engineering

    Alguien me preguntó la diferencia entre "MCP" y "una tool". Dudé. Llevo tiempo usando ambos todos los días y no supe explicarlo en una frase. Así que armé este diccionario: los 36…

    6 min // 300 xp

  • AI #ai #antigravity

    Migrating from Gemini to Antigravity CLI

    Anteriormente hablamos de los anuncios del Google I/O 2026, y cómo estamos entrando a la era de Agent-First con Antigravity

    5 min // 250 xp

  • AI #ai #google

    Google AI Studio: Google's All-in-One Platform

    La evolución del desarrollo de software ha alcanzado un punto de inflexión con la consolidación del "Vibe Coding" y el desarrollo basado en agentes. Google AI Studio ha trascendido…

    4 min // 200 xp

  • AI #claude code #claude

    Orchestration Patterns in Claude Code

    La mayoría de los tutoriales sobre agentes de IA muestran un agente haciendo todo. Eso funciona para demos, pero no para producción.

    7 min // 350 xp

  • AI #deferrable views #angular

    Deferrable Views in Angular: Load What You Need, When You Need It

    Cuando Angular compila tu aplicación, todo lo que importas en un componente acaba en el bundle. No importa si ese componente se renderiza en la primera pantalla o si el usuario tie…

    10 min // 500 xp

  • AI #claude code #claude

    ¿Qué son las famosas Skills en claude code?

    Si estás al día en tech en redes, o al menos lo intentas, habrás escuchado ya mil veces la palabras "skills", desde personas explicando qué son y como mejora su flujo de trabajo, h…

    10 min // 500 xp