Saltar al contenido

[ Bitácora y pergaminos ]Categoría: AI // 52 posts

Blog

Artículos sobre AI escritos con experiencia de primera mano por Kevin Davila, Google Developer Expert.

  • AI #vllm #servir modelos de ia

    Qué es servir un modelo de IA (y por qué existe vLLM)

    Servir un modelo de IA es convertir un archivo de pesos en una API que responde preguntas. Ese es el oficio completo de un inference engineer, y esta guía te lleva de cero a tu pro…

    5 min // 250 xp

  • AI #ollama #modelo local

    Tu primer modelo local en 10 minutos (Ollama)

    Antes de alquilar una sola GPU, vamos a correr un modelo en tu propia máquina. Gratis, sin cuenta, en 10 minutos. El objetivo no es producción: es que entiendas el ciclo completo d…

    4 min // 200 xp

  • AI #runpod #alquilar gpu

    Alquila tu primera GPU sin miedo (~$1 la hora)

    Llegó la hora del hardware de verdad. Vamos a alquilar una GPU de 48 GB, correr nuestros primeros comandos y apagarla sin dejar dinero tirado. Presupuesto total del capítulo: ~$3.…

    3 min // 150 xp

  • AI #vllm flags #gpu-memory-utilization

    Los 5 flags de vLLM que importan de verdad

    vLLM tiene más de cien flags de configuración. Cinco deciden cuánto contexto aguantas, cuánto gastas y si tu agente funciona. Los demás son tuning fino para cuando ya mides. Este c…

    4 min // 200 xp

  • AI #vllm serve #primer servidor vllm

    Tu primer servidor vLLM (hello world)

    El pod ya corre. Ahora lo importante: instalar vLLM, descargar un modelo de 30B y encender tu primer servidor de inferencia en internet. Son 20 minutos de trabajo real; el resto es…

    3 min // 150 xp

  • AI #vllm troubleshooting #errores gpu alquilada

    Cuando explota: los 7 errores de servir vLLM en GPU alquilada

    Tu servidor va a fallar. No es pesimismo, es estadística: alquilaste un contenedor efímero, descargaste 31 GB de pesos y levantaste tres servicios que se conocieron hoy. La diferen…

    4 min // 200 xp

  • AI #medir vllm #benchmark ttft

    Mide tu vLLM: TTFT, tokens/s y concurrencia sin engañarte

    Un servidor que "funciona" no dice nada. La pregunta de un engineer es cuánto: cuánto tarda el primer token, cuántos tokens por segundo, cuántas personas a la vez. Este capítulo te…

    4 min // 200 xp

  • AI #litellm gateway #virtual keys

    LiteLLM: llaves, presupuestos y la factura de tu vLLM

    Tu vLLM está en internet con una sola API key compartida. Eso está bien para ti solo. Para un equipo es un desastre: nadie sabe quién gasta qué, y quitarle el acceso a alguien sign…

    5 min // 250 xp

  • AI #antigravity sdk #gemma 4

    Antigravity SDK con modelos locales: tu GPU, tus tokens, cero nube

    Un domingo a las 00:14 mi pipeline de contenido se quedó sin cuota. No fue un bug. La API me devolvió un 429 a mitad del batch y el job murió dejando 18 posts a medio generar. Me q…

    9 min // 450 xp

  • AI #model routing #costos de ai

    Model routing y costos: cuándo el modelo caro y cuándo el barato

    El camino más rápido para bajar la factura de AI no es negociar precios: es dejar de mandar todo al modelo caro. Clasificar un ticket, extraer un campo o resumir un texto no necesi…

    3 min // 150 xp

  • AI #migrar a self-hosted #costo de llm

    El informe que dijo "no migren todavía"

    El PoC salió bien. El servidor levantaba, respondía, aguantaba 10 personas y costaba centavos al día. Y la recomendación que escribí fue: no migren todavía. No por miedo: por las c…

    3 min // 150 xp

  • AI #moe #mixture of experts

    MoE por dentro: 30B totales, 3B activos

    Un modelo de 30B que genera más rápido que uno de 7B. Suena a magia hasta que entiendes la arquitectura: no todos los parámetros se despiertan en cada token. En un modelo MoE (Mixt…

    2 min // 100 xp

  • AI #observabilidad agentes #trazas

    Observabilidad y trazas: "falló el modelo" casi nunca es el modelo

    Cuando un agente falla, el reflejo es culpar al modelo. Casi siempre el culpable es el harness: contexto que se recortó mal, una tool que devolvió un error silencioso, un timeout,…

    3 min // 150 xp

  • AI #kv cache #vram

    48 KB por token: por qué 48 GB no aguantan 30 sesiones

    La pregunta era: ¿cuántas personas caben en una GPU de 48 GB? Y la respuesta no la decide la potencia de la tarjeta, ni los 30B del modelo, ni el batching. La decide una multiplica…

    3 min // 150 xp

  • AI #latencia de inferencia #ttft

    El cuello de botella no era la GPU: era la red

    Un usuario. Una pregunta. 2.541 ms hasta el primer token. Con una L40S de 48 GB delante. Si el modelo tarda decenas de milisegundos en responder, ¿dónde se fueron los dos segundos…

    3 min // 150 xp

  • AI #prefix caching #kv cache

    Prefix caching: la misma carga, 3× más rápido

    16,1 segundos a 5,2. El mismo modelo, la misma GPU, las mismas 10 peticiones al mismo contexto. Lo único que cambió: si el prefijo ya estaba en caché. Si sirves un agente, esto es…

    3 min // 150 xp

  • AI #benchmark llm #error de medición

    El error de mi propio benchmark

    Publicamos el primer barrido de concurrencia y los números eran demasiado buenos: 10 usuarios simultáneos, todos rápidos, sin un solo fallo. Antes de celebrar, revisamos una cosa:…

    3 min // 150 xp

  • AI #servir varios modelos #model routing

    Servir varios modelos en producción: routing, versionado y canary

    Tu app no necesita el modelo más caro para el 80% de las peticiones. Pero tampoco puedes hardcodear un modelo en cada archivo y esperar poder cambiarlo cuando salga uno mejor. La c…

    3 min // 150 xp

  • AI #fine-tuning #rag

    Fine-tuning vs RAG vs prompting: cuándo cada uno

    Cada pocas semanas alguien me dice que va a hacer fine-tuning. Casi nunca es lo que necesita: el 90% de los problemas que se atribuyen a "el modelo no sabe" se resuelven con mejor…

    3 min // 150 xp

  • AI #vllm producción #entorno alquilado

    Los 7 bugs del entorno alquilado

    El primer intento de levantar el servidor falló tres veces seguidas, por tres causas distintas, ninguna relacionada con el modelo. Al final de la semana teníamos una lista de siete…

    3 min // 150 xp

  • AI #servir un modelo propio #vllm

    Plan: servir mi propio modelo para bajar la factura

    La factura de los asistentes de código crecía con el equipo, y la pregunta era simple: ¿se puede servir un modelo open-source nosotros mismos y pagar menos? La respuesta honesta es…

    3 min // 150 xp

  • AI #rag #chunking

    RAG que funciona: chunking, reranking y hybrid search

    "Mi RAG no funciona" casi nunca significa "mi modelo es malo". Significa que el fragmento correcto no llegó al contexto: se cortó mal, se rankeó mal o no se encontró. El 80% de la…

    4 min // 200 xp

  • AI #agent skills #skill.md

    Skills que sobrevivieron: anatomía de una skill que funciona

    Instalé skills de más. Al principio todas parecían útiles y al cabo de un mes casi ninguna se disparaba. Lo que me hizo reaccionar fue un dato ajeno: cuando un catálogo conocido de…

    3 min // 150 xp

  • AI #costo de ai #precio por millón de tokens

    El costo real de tu feature de AI: API vs self-host vs borde

    La pregunta no llega en el diseño: llega con la factura. "¿Cuánto cuesta cada usuario?" es la pregunta que separa un feature de un producto, y se responde con tres datos: tokens po…

    3 min // 150 xp

  • AI #serving de llm #batching continuo

    Servir en producción: batching, concurrencia y autoscaling

    Mi servidor respondía perfecto con un usuario y se arrastraba con diez. La culpa no era del modelo ni de la GPU: era que atendía las peticiones de a una. El mismo modelo, la misma…

    3 min // 150 xp

  • AI #gpu para llm #vram necesaria

    ¿Qué hardware necesitas? GPU, VRAM y cloud

    "¿Compro una GPU o alquilo?" es la pregunta equivocada. La correcta es: ¿cuántas horas al mes la voy a usar? Todo lo demás (modelo, VRAM, precio) se deriva de esa cifra y de una cu…

    3 min // 150 xp

  • AI #cuantización #4-bit

    Cuantización con números: calidad vs VRAM vs velocidad

    Un modelo que pesa 40 GB corriendo en una GPU de 16 GB. Eso no es un truco de marketing: es cuantización, y en un experimento documentado por Hugging Face fue exactamente el result…

    3 min // 150 xp

  • AI #codebase para agentes #módulos profundos

    Diseña tu repo para que los agentes trabajen mejor

    Tu codebase influye más en el resultado del agente que tu prompt o tu AGENTS.md. Y eso es una buena noticia: es lo único de la lista que puedes diseñar en lugar de redactar mejor.

    3 min // 150 xp

  • AI #structured outputs #json válido

    Structured outputs sin sufrimiento: JSON que no falla

    En la demo el JSON sale bien. En producción, cuando el input es raro o la respuesta se alarga, sale casi bien. Y "casi" es un bug: un campo que falta a las 3 de la mañana es una pá…

    4 min // 200 xp

  • AI #flujo de trabajo con ai #desarrollo web con agentes

    Mi flujo completo de AI en desarrollo web: del issue al deploy

    El error de mis primeros meses con agentes fue pedir código. "Hazme esta feature" y esperar magia. El resultado era predecible: código que funcionaba a medias, revisiones eternas y…

    3 min // 150 xp

  • AI #servidor mcp #model context protocol

    Escribe tu servidor MCP (y sus footguns)

    Mi servidor MCP funcionaba perfecto en local. Agregué un console.log para depurar una respuesta rara, y el cliente dejó de responder. Sin error, sin mensaje: dejó de funcionar. Pas…

    4 min // 200 xp

  • AI #vercel ai sdk #toolloopagent

    Agentes con Vercel AI SDK 7: ToolLoopAgent y HarnessAgent

    Veinte líneas. Un agente con tools, loop y condición de parada, sin escribir el ciclo a mano. Eso es lo que te da ToolLoopAgent del AI SDK, y es la razón por la que hoy es mi punto…

    4 min // 200 xp

  • AI #google adk #adk 2.0

    Agentes con ADK 2.0: cuándo el framework te ahorra meses

    Cuando escribí mi primer agente "puro" con archivos markdown, entendí el harness. Cuando intenté ponerlo en producción, entendí para qué sirve un framework: sesiones, evaluación, t…

    3 min // 150 xp

  • AI #agente con markdown #agents.md

    Tu primer agente "puro": solo archivos markdown

    Sin SDK, sin framework, sin servidor. Cuatro archivos de texto y un agente que funciona. Suena a truco, pero es la forma más rápida de entender qué es un agente de verdad: si no pu…

    4 min // 200 xp

  • AI #evals #evaluar agentes

    Evals: los 3 tipos, y cómo saber si tu agente mejoró

    Durante semanas creí que mi agente mejoraba. Cambiaba el prompt, probaba dos o tres casos, quedaba convencido y lo dejaba así. Hasta que un día noté que había empeorado en lo que a…

    4 min // 200 xp

  • AI #guardrails agentes #permisos de tools

    Guardrails: permisos, sandbox y clasificadores (patrón System One)

    Un chatbot que se equivoca te da una respuesta mala. Un agente que se equivoca hace algo: borra un archivo, hace push a main, manda un correo, gasta 200 dólares en una API. Por eso…

    4 min // 200 xp

  • AI #harness engineering #agente

    Harness Engineering: las 9 piezas, construidas y medidas

    Llevaba meses intentando explicar por qué dos equipos con el mismo modelo obtienen resultados opuestos. El marco que me faltaba: no compites por el modelo, compites por el harness.…

    4 min // 200 xp

  • AI #qué es un agente #agent loop

    Qué es un agente, de verdad: modelo + harness

    La primera vez que construí un "agente" era un prompt de 800 palabras con instrucciones numeradas. Funcionó sorprendentemente bien durante dos semanas. Después empezó a fallar: olv…

    5 min // 250 xp

  • AI #ai engineer #qué es un ai engineer

    Qué es un AI Engineer (y mi ruta desde Frontend)

    Mi perfil dice Frontend Engineer. La semana pasada pasé tres horas midiendo VRAM, comparando cuantizaciones y peleándome con el max-model-len de un servidor de inferencia. No hubo…

    4 min // 200 xp

  • AI #diccionario ai #ai engineering

    Diccionario AI: 36 términos para entender AI Engineering

    Alguien me preguntó la diferencia entre "MCP" y "una tool". Dudé. Llevo tiempo usando ambos todos los días y no supe explicarlo en una frase. Así que armé este diccionario: los 36…

    6 min // 300 xp

  • AI #ai #antigravity

    Migrando de Gemini a Antigravity CLI

    Anteriormente hablamos de los anuncios del Google I/O 2026, y cómo estamos entrando a la era de Agent-First con Antigravity

    5 min // 250 xp

  • AI #ai #google

    Google AI Studio: La Plataforma Integral de Google

    La evolución del desarrollo de software ha alcanzado un punto de inflexión con la consolidación del "Vibe Coding" y el desarrollo basado en agentes. Google AI Studio ha trascendido…

    4 min // 200 xp

  • AI #claude code #claude

    Patrones de orquestación en Claude Code

    La mayoría de los tutoriales sobre agentes de IA muestran un agente haciendo todo. Eso funciona para demos, pero no para producción.

    7 min // 350 xp

  • AI

    ¿Qué son las famosas Skills en claude code?

    Si estás al día en tech en redes, o al menos lo intentas, habrás escuchado ya mil veces la palabras "skills", desde personas explicando qué son y como mejora su flujo de trabajo, h…

    10 min // 500 xp