[ Bitácora y pergaminos ]Categoría: AI // 52 posts
Blog
Artículos sobre AI escritos con experiencia de primera mano por Kevin Davila, Google Developer Expert.
- OCT 2026AI #vllm #servir modelos de ia
Qué es servir un modelo de IA (y por qué existe vLLM)
Servir un modelo de IA es convertir un archivo de pesos en una API que responde preguntas. Ese es el oficio completo de un inference engineer, y esta guía te lleva de cero a tu pro…
5 min // 250 xp
- OCT 2026AI #ollama #modelo local
Tu primer modelo local en 10 minutos (Ollama)
Antes de alquilar una sola GPU, vamos a correr un modelo en tu propia máquina. Gratis, sin cuenta, en 10 minutos. El objetivo no es producción: es que entiendas el ciclo completo d…
4 min // 200 xp
- OCT 2026AI #runpod #alquilar gpu
Alquila tu primera GPU sin miedo (~$1 la hora)
Llegó la hora del hardware de verdad. Vamos a alquilar una GPU de 48 GB, correr nuestros primeros comandos y apagarla sin dejar dinero tirado. Presupuesto total del capítulo: ~$3.…
3 min // 150 xp
- OCT 2026AI #vllm flags #gpu-memory-utilization
Los 5 flags de vLLM que importan de verdad
vLLM tiene más de cien flags de configuración. Cinco deciden cuánto contexto aguantas, cuánto gastas y si tu agente funciona. Los demás son tuning fino para cuando ya mides. Este c…
4 min // 200 xp
- OCT 2026AI #vllm serve #primer servidor vllm
Tu primer servidor vLLM (hello world)
El pod ya corre. Ahora lo importante: instalar vLLM, descargar un modelo de 30B y encender tu primer servidor de inferencia en internet. Son 20 minutos de trabajo real; el resto es…
3 min // 150 xp
- OCT 2026AI #vllm troubleshooting #errores gpu alquilada
Cuando explota: los 7 errores de servir vLLM en GPU alquilada
Tu servidor va a fallar. No es pesimismo, es estadística: alquilaste un contenedor efímero, descargaste 31 GB de pesos y levantaste tres servicios que se conocieron hoy. La diferen…
4 min // 200 xp
- OCT 2026AI #medir vllm #benchmark ttft
Mide tu vLLM: TTFT, tokens/s y concurrencia sin engañarte
Un servidor que "funciona" no dice nada. La pregunta de un engineer es cuánto: cuánto tarda el primer token, cuántos tokens por segundo, cuántas personas a la vez. Este capítulo te…
4 min // 200 xp
- OCT 2026AI #litellm gateway #virtual keys
LiteLLM: llaves, presupuestos y la factura de tu vLLM
Tu vLLM está en internet con una sola API key compartida. Eso está bien para ti solo. Para un equipo es un desastre: nadie sabe quién gasta qué, y quitarle el acceso a alguien sign…
5 min // 250 xp
- OCT 2026AI #antigravity sdk #gemma 4
Antigravity SDK con modelos locales: tu GPU, tus tokens, cero nube
Un domingo a las 00:14 mi pipeline de contenido se quedó sin cuota. No fue un bug. La API me devolvió un 429 a mitad del batch y el job murió dejando 18 posts a medio generar. Me q…
9 min // 450 xp
- OCT 2026AI #stitch cli #google stitch
Stitch CLI: Google trae el diseño de UI a la terminal (y a tu agente)
Google presentó Stitch CLI, una herramienta de línea de comandos (@google/stitch) que lleva el diseño de UI generativo de Stitch a la terminal y a tu agente de código. La promesa o…
11 min // 550 xp
- SEP 2026AI #model routing #costos de ai
Model routing y costos: cuándo el modelo caro y cuándo el barato
El camino más rápido para bajar la factura de AI no es negociar precios: es dejar de mandar todo al modelo caro. Clasificar un ticket, extraer un campo o resumir un texto no necesi…
3 min // 150 xp
- SEP 2026AI #migrar a self-hosted #costo de llm
El informe que dijo "no migren todavía"
El PoC salió bien. El servidor levantaba, respondía, aguantaba 10 personas y costaba centavos al día. Y la recomendación que escribí fue: no migren todavía. No por miedo: por las c…
3 min // 150 xp
- SEP 2026AI #moe #mixture of experts
MoE por dentro: 30B totales, 3B activos
Un modelo de 30B que genera más rápido que uno de 7B. Suena a magia hasta que entiendes la arquitectura: no todos los parámetros se despiertan en cada token. En un modelo MoE (Mixt…
2 min // 100 xp
- SEP 2026AI #observabilidad agentes #trazas
Observabilidad y trazas: "falló el modelo" casi nunca es el modelo
Cuando un agente falla, el reflejo es culpar al modelo. Casi siempre el culpable es el harness: contexto que se recortó mal, una tool que devolvió un error silencioso, un timeout,…
3 min // 150 xp
- SEP 2026AI #kv cache #vram
48 KB por token: por qué 48 GB no aguantan 30 sesiones
La pregunta era: ¿cuántas personas caben en una GPU de 48 GB? Y la respuesta no la decide la potencia de la tarjeta, ni los 30B del modelo, ni el batching. La decide una multiplica…
3 min // 150 xp
- SEP 2026AI #latencia de inferencia #ttft
El cuello de botella no era la GPU: era la red
Un usuario. Una pregunta. 2.541 ms hasta el primer token. Con una L40S de 48 GB delante. Si el modelo tarda decenas de milisegundos en responder, ¿dónde se fueron los dos segundos…
3 min // 150 xp
- SEP 2026AI #elegir modelo llm #abierto vs cerrado
Elegir modelo en 2026: 5 preguntas (y la nueva categoría de decisión)
No existe "el mejor modelo". Existe el modelo que responde estas cinco preguntas con tus datos. Y en 2026 apareció una sexta pregunta que cambia el juego: no siempre necesitas un m…
3 min // 150 xp
- SEP 2026AI #prefix caching #kv cache
Prefix caching: la misma carga, 3× más rápido
16,1 segundos a 5,2. El mismo modelo, la misma GPU, las mismas 10 peticiones al mismo contexto. Lo único que cambió: si el prefijo ya estaba en caché. Si sirves un agente, esto es…
3 min // 150 xp
- SEP 2026AI #benchmark llm #error de medición
El error de mi propio benchmark
Publicamos el primer barrido de concurrencia y los números eran demasiado buenos: 10 usuarios simultáneos, todos rápidos, sin un solo fallo. Antes de celebrar, revisamos una cosa:…
3 min // 150 xp
- SEP 2026AI #servir varios modelos #model routing
Servir varios modelos en producción: routing, versionado y canary
Tu app no necesita el modelo más caro para el 80% de las peticiones. Pero tampoco puedes hardcodear un modelo en cada archivo y esperar poder cambiarlo cuando salga uno mejor. La c…
3 min // 150 xp
- SEP 2026AI #fine-tuning #rag
Fine-tuning vs RAG vs prompting: cuándo cada uno
Cada pocas semanas alguien me dice que va a hacer fine-tuning. Casi nunca es lo que necesita: el 90% de los problemas que se atribuyen a "el modelo no sabe" se resuelven con mejor…
3 min // 150 xp
- SEP 2026AI #vllm producción #entorno alquilado
Los 7 bugs del entorno alquilado
El primer intento de levantar el servidor falló tres veces seguidas, por tres causas distintas, ninguna relacionada con el modelo. Al final de la semana teníamos una lista de siete…
3 min // 150 xp
- SEP 2026AI #servir un modelo propio #vllm
Plan: servir mi propio modelo para bajar la factura
La factura de los asistentes de código crecía con el equipo, y la pregunta era simple: ¿se puede servir un modelo open-source nosotros mismos y pagar menos? La respuesta honesta es…
3 min // 150 xp
- SEP 2026AI #rag #chunking
RAG que funciona: chunking, reranking y hybrid search
"Mi RAG no funciona" casi nunca significa "mi modelo es malo". Significa que el fragmento correcto no llegó al contexto: se cortó mal, se rankeó mal o no se encontró. El 80% de la…
4 min // 200 xp
- SEP 2026AI #agent skills #skill.md
Skills que sobrevivieron: anatomía de una skill que funciona
Instalé skills de más. Al principio todas parecían útiles y al cabo de un mes casi ninguna se disparaba. Lo que me hizo reaccionar fue un dato ajeno: cuando un catálogo conocido de…
3 min // 150 xp
- SEP 2026AI #costo de ai #precio por millón de tokens
El costo real de tu feature de AI: API vs self-host vs borde
La pregunta no llega en el diseño: llega con la factura. "¿Cuánto cuesta cada usuario?" es la pregunta que separa un feature de un producto, y se responde con tres datos: tokens po…
3 min // 150 xp
- SEP 2026AI #medir inferencia #ttft
Medir inferencia sin engañarte: tokens/s, TTFT y benchmarks mentirosos
Un benchmark puede hacerte creer que el modelo A es el doble de rápido que el B, y ser completamente falso por cómo se midió. Me pasó mirando números publicados: dos "tokens/s" que…
4 min // 200 xp
- AGO 2026AI #serving de llm #batching continuo
Servir en producción: batching, concurrencia y autoscaling
Mi servidor respondía perfecto con un usuario y se arrastraba con diez. La culpa no era del modelo ni de la GPU: era que atendía las peticiones de a una. El mismo modelo, la misma…
3 min // 150 xp
- AGO 2026AI #gpu para llm #vram necesaria
¿Qué hardware necesitas? GPU, VRAM y cloud
"¿Compro una GPU o alquilo?" es la pregunta equivocada. La correcta es: ¿cuántas horas al mes la voy a usar? Todo lo demás (modelo, VRAM, precio) se deriva de esa cifra y de una cu…
3 min // 150 xp
- AGO 2026AI #cuantización #4-bit
Cuantización con números: calidad vs VRAM vs velocidad
Un modelo que pesa 40 GB corriendo en una GPU de 16 GB. Eso no es un truco de marketing: es cuantización, y en un experimento documentado por Hugging Face fue exactamente el result…
3 min // 150 xp
- AGO 2026AI #inferencia local #lm studio
Inferencia local en 2026: de LM Studio a vLLM (con matemática de VRAM)
Instalé LM Studio un sábado por curiosidad. Dos horas después tenía un modelo corriendo en mi máquina y una pregunta nueva: si esto es tan fácil, ¿por qué la gente habla de VRAM co…
3 min // 150 xp
- AGO 2026AI #codebase para agentes #módulos profundos
Diseña tu repo para que los agentes trabajen mejor
Tu codebase influye más en el resultado del agente que tu prompt o tu AGENTS.md. Y eso es una buena noticia: es lo único de la lista que puedes diseñar en lugar de redactar mejor.
3 min // 150 xp
- AGO 2026AI #structured outputs #json válido
Structured outputs sin sufrimiento: JSON que no falla
En la demo el JSON sale bien. En producción, cuando el input es raro o la respuesta se alarga, sale casi bien. Y "casi" es un bug: un campo que falta a las 3 de la mañana es una pá…
4 min // 200 xp
- JUL 2026AI #agents.md #claude.md
AGENTS.md vs CLAUDE.md vs rules: el contexto que el agente sí lee
Casi todo lo que escribes en tu AGENTS.md se ignora. Y no es culpa del agente: es que cada token de ese archivo se carga en cada petición, compita o no con la tarea del momento. Si…
4 min // 200 xp
- JUL 2026AI #flujo de trabajo con ai #desarrollo web con agentes
Mi flujo completo de AI en desarrollo web: del issue al deploy
El error de mis primeros meses con agentes fue pedir código. "Hazme esta feature" y esperar magia. El resultado era predecible: código que funcionaba a medias, revisiones eternas y…
3 min // 150 xp
- JUL 2026AI #servidor mcp #model context protocol
Escribe tu servidor MCP (y sus footguns)
Mi servidor MCP funcionaba perfecto en local. Agregué un console.log para depurar una respuesta rara, y el cliente dejó de responder. Sin error, sin mensaje: dejó de funcionar. Pas…
4 min // 200 xp
- JUL 2026AI #vercel ai sdk #toolloopagent
Agentes con Vercel AI SDK 7: ToolLoopAgent y HarnessAgent
Veinte líneas. Un agente con tools, loop y condición de parada, sin escribir el ciclo a mano. Eso es lo que te da ToolLoopAgent del AI SDK, y es la razón por la que hoy es mi punto…
4 min // 200 xp
- JUL 2026AI #google adk #adk 2.0
Agentes con ADK 2.0: cuándo el framework te ahorra meses
Cuando escribí mi primer agente "puro" con archivos markdown, entendí el harness. Cuando intenté ponerlo en producción, entendí para qué sirve un framework: sesiones, evaluación, t…
3 min // 150 xp
- JUL 2026AI #agente con markdown #agents.md
Tu primer agente "puro": solo archivos markdown
Sin SDK, sin framework, sin servidor. Cuatro archivos de texto y un agente que funciona. Suena a truco, pero es la forma más rápida de entender qué es un agente de verdad: si no pu…
4 min // 200 xp
- JUL 2026AI #evals #evaluar agentes
Evals: los 3 tipos, y cómo saber si tu agente mejoró
Durante semanas creí que mi agente mejoraba. Cambiaba el prompt, probaba dos o tres casos, quedaba convencido y lo dejaba así. Hasta que un día noté que había empeorado en lo que a…
4 min // 200 xp
- JUL 2026AI #guardrails agentes #permisos de tools
Guardrails: permisos, sandbox y clasificadores (patrón System One)
Un chatbot que se equivoca te da una respuesta mala. Un agente que se equivoca hace algo: borra un archivo, hace push a main, manda un correo, gasta 200 dólares en una API. Por eso…
4 min // 200 xp
- JUN 2026AI #context engineering #compaction
Context engineering práctico: compaction, retrieval y por qué tu agente olvida
Paso 3: encontraste el bug. Paso 7: ya no lo recuerda. Paso 12: propone una solución que arregla algo que ya habías arreglado. Si te pasó, tu agente no es "tonto": se quedó sin con…
3 min // 150 xp
- JUN 2026AI #harness engineering #agente
Harness Engineering: las 9 piezas, construidas y medidas
Llevaba meses intentando explicar por qué dos equipos con el mismo modelo obtienen resultados opuestos. El marco que me faltaba: no compites por el modelo, compites por el harness.…
4 min // 200 xp
- JUN 2026AI #inference engineering #ttft
Inference Engineering: qué es y qué se optimiza (TTFT, tokens/s, VRAM, costo)
El mismo modelo, la misma GPU, la misma pregunta. Un servidor responde con el primer token en 300 ms; otro tarda casi dos segundos. La diferencia no está en el modelo. Está en todo…
4 min // 200 xp
- JUN 2026AI #qué es un agente #agent loop
Qué es un agente, de verdad: modelo + harness
La primera vez que construí un "agente" era un prompt de 800 palabras con instrucciones numeradas. Funcionó sorprendentemente bien durante dos semanas. Después empezó a fallar: olv…
5 min // 250 xp
- JUN 2026AI #ai engineer #qué es un ai engineer
Qué es un AI Engineer (y mi ruta desde Frontend)
Mi perfil dice Frontend Engineer. La semana pasada pasé tres horas midiendo VRAM, comparando cuantizaciones y peleándome con el max-model-len de un servidor de inferencia. No hubo…
4 min // 200 xp
- JUN 2026AI #diccionario ai #ai engineering
Diccionario AI: 36 términos para entender AI Engineering
Alguien me preguntó la diferencia entre "MCP" y "una tool". Dudé. Llevo tiempo usando ambos todos los días y no supe explicarlo en una frase. Así que armé este diccionario: los 36…
6 min // 300 xp
- MAY 2026AI #ai #antigravity
Migrando de Gemini a Antigravity CLI
Anteriormente hablamos de los anuncios del Google I/O 2026, y cómo estamos entrando a la era de Agent-First con Antigravity
5 min // 250 xp
- ABR 2026AI #ai #google
Google AI Studio: La Plataforma Integral de Google
La evolución del desarrollo de software ha alcanzado un punto de inflexión con la consolidación del "Vibe Coding" y el desarrollo basado en agentes. Google AI Studio ha trascendido…
4 min // 200 xp
- ABR 2026AI #claude code #claude
Patrones de orquestación en Claude Code
La mayoría de los tutoriales sobre agentes de IA muestran un agente haciendo todo. Eso funciona para demos, pero no para producción.
7 min // 350 xp
- ABR 2026AI #deferrable views #angular
Deferrable Views en Angular: carga lo que necesitas, cuando lo necesitas
Cuando Angular compila tu aplicación, todo lo que importas en un componente acaba en el bundle. No importa si ese componente se renderiza en la primera pantalla o si el usuario tie…
10 min // 500 xp
- ABR 2026AI
¿Qué son las famosas Skills en claude code?
Si estás al día en tech en redes, o al menos lo intentas, habrás escuchado ya mil veces la palabras "skills", desde personas explicando qué son y como mejora su flujo de trabajo, h…
10 min // 500 xp