[ Scrolls & chronicles ]Category: AI // 52 posts
Blog
Articles about AI written from first-hand experience by Kevin Davila, Google Developer Expert.
- OCT 2026AI #vllm #servir modelos de ia
What Serving an AI Model Actually Means (and Why vLLM Exists)
Serving an AI model means turning a file of weights into an API that answers questions. That's the whole job of an inference engineer, and this guide takes you from zero to your ow…
5 min // 250 xp
- OCT 2026AI #ollama #modelo local
Your First Local Model in 10 Minutes (Ollama)
Before renting a single GPU, let's run a model on your own machine. Free, no account, 10 minutes. The goal isn't production: it's understanding the full request-to-tokens cycle, wh…
4 min // 200 xp
- OCT 2026AI #runpod #alquilar gpu
Rent Your First GPU Without Fear (~$1 per hour)
It's time for real hardware. We'll rent a 48 GB GPU, run our first commands, and shut it down without leaving money behind. Total chapter budget: ~$3. You buy nothing.
3 min // 150 xp
- OCT 2026AI #vllm flags #gpu-memory-utilization
The 5 vLLM Flags That Actually Matter
vLLM has over a hundred configuration flags. Five decide how much context you hold, how much you spend, and whether your agent works. The rest is fine tuning for when you already m…
4 min // 200 xp
- OCT 2026AI #vllm serve #primer servidor vllm
Your First vLLM Server (hello world)
The pod is running. Now the important part: install vLLM, download a 30B model, and turn on your first inference server on the internet. It's 20 minutes of real work; the rest is d…
3 min // 150 xp
- OCT 2026AI #vllm troubleshooting #errores gpu alquilada
When It Explodes: The 7 Errors of Serving vLLM on a Rented GPU
Your server will fail. That's not pessimism, it's statistics: you rented an ephemeral container, downloaded 31 GB of weights, and started three services that met each other today.…
4 min // 200 xp
- OCT 2026AI #medir vllm #benchmark ttft
Measure Your vLLM: TTFT, tokens/s and Concurrency Without Fooling Yourself
A server that "works" says nothing. The engineer's question is how much: how long until the first token, how many tokens per second, how many people at once. This chapter leaves yo…
4 min // 200 xp
- OCT 2026AI #litellm gateway #virtual keys
LiteLLM: Keys, Budgets and Your vLLM's Bill
Your vLLM is on the internet with a single shared API key. That's fine for you alone. For a team it's a mess: nobody knows who spends what, and revoking someone's access means chan…
4 min // 200 xp
- OCT 2026AI #antigravity sdk #gemma 4
Antigravity SDK with Local Models: Your GPU, Your Tokens, Zero Cloud
At 12:14 AM on a Sunday, my content pipeline ran out of quota. It wasn't a bug. The API returned a 429 halfway through the batch and the job died with 18 posts half-generated. I sa…
9 min // 450 xp
- OCT 2026AI #stitch cli #google stitch
Stitch CLI: Google Brings UI Design to the Terminal (and to Your Agent)
Google has introduced Stitch CLI, a command-line tool (@google/stitch) that brings Stitch's generative UI design to the terminal and to your coding agent. The official promise: "yo…
11 min // 550 xp
- SEP 2026AI #model routing #ai costs
Model routing and costs: when to pay for the expensive model
El camino más rápido para bajar la factura de AI no es negociar precios: es dejar de mandar todo al modelo caro. Clasificar un ticket, extraer un campo o resumir un texto no necesi…
3 min // 150 xp
- SEP 2026AI #migrating to self-hosted #llm cost
The report that said "do not migrate yet"
El PoC salió bien. El servidor levantaba, respondía, aguantaba 10 personas y costaba centavos al día. Y la recomendación que escribí fue: no migren todavía. No por miedo: por las c…
3 min // 150 xp
- SEP 2026AI #moe #mixture of experts
Inside MoE: 30B total, 3B active
Un modelo de 30B que genera más rápido que uno de 7B. Suena a magia hasta que entiendes la arquitectura: no todos los parámetros se despiertan en cada token. En un modelo MoE (Mixt…
2 min // 100 xp
- SEP 2026AI #agent observability #traces
Observability and traces: "the model failed" is rarely the model
Cuando un agente falla, el reflejo es culpar al modelo. Casi siempre el culpable es el harness: contexto que se recortó mal, una tool que devolvió un error silencioso, un timeout,…
3 min // 150 xp
- SEP 2026AI #kv cache #vram
48 KB per token: why 48 GB cannot hold 30 sessions
La pregunta era: ¿cuántas personas caben en una GPU de 48 GB? Y la respuesta no la decide la potencia de la tarjeta, ni los 30B del modelo, ni el batching. La decide una multiplica…
3 min // 150 xp
- SEP 2026AI #inference latency #ttft
The bottleneck was not the GPU: it was the network
Un usuario. Una pregunta. 2.541 ms hasta el primer token. Con una L40S de 48 GB delante. Si el modelo tarda decenas de milisegundos en responder, ¿dónde se fueron los dos segundos…
3 min // 150 xp
- SEP 2026AI #choosing an llm #open vs closed
Choosing a model in 2026: 5 questions (and the new decision category)
No existe "el mejor modelo". Existe el modelo que responde estas cinco preguntas con tus datos. Y en 2026 apareció una sexta pregunta que cambia el juego: no siempre necesitas un m…
3 min // 150 xp
- SEP 2026AI #prefix caching #kv cache
Prefix caching: same load, 3x faster
16,1 segundos a 5,2. El mismo modelo, la misma GPU, las mismas 10 peticiones al mismo contexto. Lo único que cambió: si el prefijo ya estaba en caché. Si sirves un agente, esto es…
3 min // 150 xp
- SEP 2026AI #llm benchmark #measurement error
The error in my own benchmark
Publicamos el primer barrido de concurrencia y los números eran demasiado buenos: 10 usuarios simultáneos, todos rápidos, sin un solo fallo. Antes de celebrar, revisamos una cosa:…
3 min // 150 xp
- SEP 2026AI #serving multiple models #model routing
Serving multiple models in production: routing, versioning and canary
Tu app no necesita el modelo más caro para el 80% de las peticiones. Pero tampoco puedes hardcodear un modelo en cada archivo y esperar poder cambiarlo cuando salga uno mejor. La c…
3 min // 150 xp
- SEP 2026AI #fine-tuning #rag
Fine-tuning vs RAG vs prompting: when to use each
Cada pocas semanas alguien me dice que va a hacer fine-tuning. Casi nunca es lo que necesita: el 90% de los problemas que se atribuyen a "el modelo no sabe" se resuelven con mejor…
3 min // 150 xp
- SEP 2026AI #vllm in production #rented environment
The 7 bugs of a rented GPU environment
El primer intento de levantar el servidor falló tres veces seguidas, por tres causas distintas, ninguna relacionada con el modelo. Al final de la semana teníamos una lista de siete…
3 min // 150 xp
- SEP 2026AI #self-hosted model #vllm
Plan: serving my own model to cut the bill
La factura de los asistentes de código crecía con el equipo, y la pregunta era simple: ¿se puede servir un modelo open-source nosotros mismos y pagar menos? La respuesta honesta es…
3 min // 150 xp
- SEP 2026AI #rag #chunking
RAG that works: chunking, reranking and hybrid search
"Mi RAG no funciona" casi nunca significa "mi modelo es malo". Significa que el fragmento correcto no llegó al contexto: se cortó mal, se rankeó mal o no se encontró. El 80% de la…
4 min // 200 xp
- SEP 2026AI #agent skills #skill.md
The skills that survived: anatomy of a skill that works
Instalé skills de más. Al principio todas parecían útiles y al cabo de un mes casi ninguna se disparaba. Lo que me hizo reaccionar fue un dato ajeno: cuando un catálogo conocido de…
3 min // 150 xp
- SEP 2026AI #ai cost #price per million tokens
The real cost of your AI feature: API vs self-host vs edge
La pregunta no llega en el diseño: llega con la factura. "¿Cuánto cuesta cada usuario?" es la pregunta que separa un feature de un producto, y se responde con tres datos: tokens po…
3 min // 150 xp
- SEP 2026AI #measuring inference #ttft
Measuring inference without lying to yourself: tokens/s, TTFT and misleading benchmarks
Un benchmark puede hacerte creer que el modelo A es el doble de rápido que el B, y ser completamente falso por cómo se midió. Me pasó mirando números publicados: dos "tokens/s" que…
4 min // 200 xp
- AUG 2026AI #llm serving #continuous batching
Serving in production: batching, concurrency and autoscaling
Mi servidor respondía perfecto con un usuario y se arrastraba con diez. La culpa no era del modelo ni de la GPU: era que atendía las peticiones de a una. El mismo modelo, la misma…
3 min // 150 xp
- AUG 2026AI #gpu for llm #vram needed
What hardware do you need? GPU, VRAM and cloud
"¿Compro una GPU o alquilo?" es la pregunta equivocada. La correcta es: ¿cuántas horas al mes la voy a usar? Todo lo demás (modelo, VRAM, precio) se deriva de esa cifra y de una cu…
3 min // 150 xp
- AUG 2026AI #quantization #4-bit
Quantization with numbers: quality vs VRAM vs speed
Un modelo que pesa 40 GB corriendo en una GPU de 16 GB. Eso no es un truco de marketing: es cuantización, y en un experimento documentado por Hugging Face fue exactamente el result…
3 min // 150 xp
- AUG 2026AI #local inference #lm studio
Local inference in 2026: from LM Studio to vLLM (with VRAM math)
Instalé LM Studio un sábado por curiosidad. Dos horas después tenía un modelo corriendo en mi máquina y una pregunta nueva: si esto es tan fácil, ¿por qué la gente habla de VRAM co…
3 min // 150 xp
- AUG 2026AI #codebase for agents #deep modules
Design your repo so agents work better
Tu codebase influye más en el resultado del agente que tu prompt o tu AGENTS.md. Y eso es una buena noticia: es lo único de la lista que puedes diseñar en lugar de redactar mejor.
3 min // 150 xp
- AUG 2026AI #structured outputs #valid json
Structured outputs without suffering: JSON that doesn't break
En la demo el JSON sale bien. En producción, cuando el input es raro o la respuesta se alarga, sale casi bien. Y "casi" es un bug: un campo que falta a las 3 de la mañana es una pá…
4 min // 200 xp
- JUL 2026AI #agents.md #claude.md
AGENTS.md vs CLAUDE.md vs rules: the context your agent actually reads
Casi todo lo que escribes en tu AGENTS.md se ignora. Y no es culpa del agente: es que cada token de ese archivo se carga en cada petición, compita o no con la tarea del momento. Si…
4 min // 200 xp
- JUL 2026AI #ai workflow #web development with agents
My complete AI web development workflow: from issue to deploy
El error de mis primeros meses con agentes fue pedir código. "Hazme esta feature" y esperar magia. El resultado era predecible: código que funcionaba a medias, revisiones eternas y…
3 min // 150 xp
- JUL 2026AI #mcp server #model context protocol
Build your MCP server (and its footguns)
Mi servidor MCP funcionaba perfecto en local. Agregué un console.log para depurar una respuesta rara, y el cliente dejó de responder. Sin error, sin mensaje: dejó de funcionar. Pas…
4 min // 200 xp
- JUL 2026AI #vercel ai sdk #toolloopagent
Agents with Vercel AI SDK 7: ToolLoopAgent and HarnessAgent
Veinte líneas. Un agente con tools, loop y condición de parada, sin escribir el ciclo a mano. Eso es lo que te da ToolLoopAgent del AI SDK, y es la razón por la que hoy es mi punto…
4 min // 200 xp
- JUL 2026AI #google adk #adk 2.0
Agents with ADK 2.0: when a framework saves you months
Cuando escribí mi primer agente "puro" con archivos markdown, entendí el harness. Cuando intenté ponerlo en producción, entendí para qué sirve un framework: sesiones, evaluación, t…
3 min // 150 xp
- JUL 2026AI #markdown agent #agents.md
Your first "pure" agent: markdown files only
Sin SDK, sin framework, sin servidor. Cuatro archivos de texto y un agente que funciona. Suena a truco, pero es la forma más rápida de entender qué es un agente de verdad: si no pu…
4 min // 200 xp
- JUL 2026AI #evals #evaluating agents
Evals: the 3 types, and how to know if your agent improved
Durante semanas creí que mi agente mejoraba. Cambiaba el prompt, probaba dos o tres casos, quedaba convencido y lo dejaba así. Hasta que un día noté que había empeorado en lo que a…
4 min // 200 xp
- JUL 2026AI #agent guardrails #tool permissions
Guardrails: permissions, sandboxes and classifiers (the System One pattern)
Un chatbot que se equivoca te da una respuesta mala. Un agente que se equivoca hace algo: borra un archivo, hace push a main, manda un correo, gasta 200 dólares en una API. Por eso…
4 min // 200 xp
- JUN 2026AI #context engineering #compaction
Practical context engineering: compaction, retrieval and why your agent forgets
Paso 3: encontraste el bug. Paso 7: ya no lo recuerda. Paso 12: propone una solución que arregla algo que ya habías arreglado. Si te pasó, tu agente no es "tonto": se quedó sin con…
3 min // 150 xp
- JUN 2026AI #harness engineering #agent
Harness Engineering: the 9 pieces, built and measured
Llevaba meses intentando explicar por qué dos equipos con el mismo modelo obtienen resultados opuestos. El marco que me faltaba: no compites por el modelo, compites por el harness.…
4 min // 200 xp
- JUN 2026AI #inference engineering #ttft
Inference Engineering: what it is and what you optimize (TTFT, tokens/s, VRAM, cost)
El mismo modelo, la misma GPU, la misma pregunta. Un servidor responde con el primer token en 300 ms; otro tarda casi dos segundos. La diferencia no está en el modelo. Está en todo…
4 min // 200 xp
- JUN 2026AI #what is an agent #agent loop
What An Agent Really Is: Model + Harness
La primera vez que construí un "agente" era un prompt de 800 palabras con instrucciones numeradas. Funcionó sorprendentemente bien durante dos semanas. Después empezó a fallar: olv…
5 min // 250 xp
- JUN 2026AI #ai engineer #what is an ai engineer
What Is An AI Engineer (And My Path From Frontend)
Mi perfil dice Frontend Engineer. La semana pasada pasé tres horas midiendo VRAM, comparando cuantizaciones y peleándome con el max-model-len de un servidor de inferencia. No hubo…
4 min // 200 xp
- JUN 2026AI #ai dictionary #ai engineering
AI Dictionary: 36 terms to understand AI Engineering
Alguien me preguntó la diferencia entre "MCP" y "una tool". Dudé. Llevo tiempo usando ambos todos los días y no supe explicarlo en una frase. Así que armé este diccionario: los 36…
6 min // 300 xp
- MAY 2026AI #ai #antigravity
Migrating from Gemini to Antigravity CLI
Anteriormente hablamos de los anuncios del Google I/O 2026, y cómo estamos entrando a la era de Agent-First con Antigravity
5 min // 250 xp
- APR 2026AI #ai #google
Google AI Studio: Google's All-in-One Platform
La evolución del desarrollo de software ha alcanzado un punto de inflexión con la consolidación del "Vibe Coding" y el desarrollo basado en agentes. Google AI Studio ha trascendido…
4 min // 200 xp
- APR 2026AI #claude code #claude
Orchestration Patterns in Claude Code
La mayoría de los tutoriales sobre agentes de IA muestran un agente haciendo todo. Eso funciona para demos, pero no para producción.
7 min // 350 xp
- APR 2026AI #deferrable views #angular
Deferrable Views in Angular: Load What You Need, When You Need It
Cuando Angular compila tu aplicación, todo lo que importas en un componente acaba en el bundle. No importa si ese componente se renderiza en la primera pantalla o si el usuario tie…
10 min // 500 xp
- APR 2026AI #claude code #claude
¿Qué son las famosas Skills en claude code?
Si estás al día en tech en redes, o al menos lo intentas, habrás escuchado ya mil veces la palabras "skills", desde personas explicando qué son y como mejora su flujo de trabajo, h…
10 min // 500 xp