Skip to content
AI•6 min read

AI Dictionary: 36 terms to understand AI Engineering

Alguien me preguntó la diferencia entre "MCP" y "una tool". Dudé. Llevo tiempo usando ambos todos los días y no supe explicarlo en una frase. Así que armé este diccionario: los 36 términos con los que se habla de AI Engineering hoy, ordenados de abajo hacia arriba, cada uno con el post donde lo profundizo.

Si recién empiezas: lee los cinco grupos en orden. Si ya estás dentro y solo quieres precisar una palabra, salta directo. Cuando un término tiene post propio, lo verás enlazado.

Conceptos base

Modelo (LLM) — Un modelo de lenguaje grande: un programa entrenado para predecir el siguiente token. No busca en internet ni recuerda tu sesión anterior; genera texto probable dado un contexto.

Token — La unidad mínima con la que trabaja el modelo. No es una palabra ni un carácter: "inferencia" puede ser un token y "inferencias" dos. Se paga, se mide y se cuenta en tokens. → Inference Engineering: qué se optimiza

Tokenizador — El traductor entre texto y tokens. Cada modelo trae el suyo, y por eso el mismo prompt cuesta distinto en modelos distintos.

Ventana de contexto — El máximo de tokens que el modelo puede leer y escribir en una sola llamada (prompt + respuesta). Todo lo que "recuerda" cabe ahí.

Contexto — Lo que el modelo ve en esta llamada: system prompt, historial, resultados de tools, archivos. Ingeniería de contexto es decidir qué entra y qué no. → Context engineering práctico

Prompt — La instrucción. En 2026 es la pieza menos diferencial de un sistema: si tu agente falla, revisa contexto, tools y evaluación antes que el prompt.

System prompt — La instrucción base que define rol, tono y reglas. Va antes de todo y suele estar fuera del control del usuario.

Razonamiento (reasoning) — Tokens que el modelo gasta "pensando" antes de responder. Mejora tareas complejas y sube latencia y costo; se regula con el nivel de esfuerzo.

No-determinismo — Dos corridas del mismo prompt pueden dar resultados distintos. Es la razón por la que necesitas evals y no solo "probé y funcionó".

Alucinación — Una respuesta falsa dicha con seguridad. No es un bug del modelo: es el modo por defecto cuando no tiene contexto suficiente.

Construir

Tool — Una función que el modelo puede pedir ejecutar (leer un archivo, consultar una base, llamar una API). El modelo no la ejecuta: la pide, y tu código decide.

Tool call — La petición estructurada del modelo ("llama a buscar_precio con sku: 123") y el resultado que le devuelves. El diseño de este contrato importa más que el prompt. → Harness Engineering: las 9 piezas

Structured outputs — Obligar al modelo a devolver un formato (JSON con esquema) en vez de texto libre. Convierte "casi siempre JSON válido" en "siempre". → Structured outputs sin sufrimiento

Skill — Un conjunto de instrucciones + recursos que le enseñas al agente para una tarea concreta (escribir un blog, revisar código). Se cargan por descripción, no todas a la vez. → Skills que sobrevivieron

Subagente — Un agente dentro de otro, con su propio contexto y tools, al que le delegas una parte del trabajo. Sirve para no reventar la ventana del agente principal.

MCP (Model Context Protocol) — El estándar para conectar tools y datos a cualquier agente: escribes un servidor MCP una vez y lo usan Claude, tu IDE o tu app. → Escribe tu servidor MCP

RAG (Retrieval-Augmented Generation) — Buscar información relevante y ponerla en el contexto antes de generar. Es la diferencia entre "el modelo inventa" y "el modelo responde con tus documentos". → RAG que funciona

Embeddings — Representaciones numéricas de texto que permiten medir similitud. Son la base de la búsqueda semántica en RAG.

Reranking — Un segundo modelo (más pequeño y preciso) que reordena los resultados de la búsqueda. Suele subir la calidad de RAG más que cambiar el modelo generador.

Fine-tuning — Reentrenar el modelo con tus datos para especializarlo. Casi siempre es el último recurso: primero prompt, luego contexto (RAG), después fine-tuning. → Fine-tuning vs RAG vs prompting

Agentes

Agente — Un modelo que decide y actúa en un loop hasta cumplir un objetivo. La definición corta: LLM + tools + loop. → Qué es un agente, de verdad

Loop del agente — El ciclo decidir → ejecutar tool → observar resultado → decidir otra vez. Necesita una condición de parada (tarea cumplida, máximo de pasos, presupuesto).

Harness — Todo lo que rodea al modelo y lo convierte en agente: loop, tools, contexto, permisos, evals, observabilidad. El modelo es el motor; el harness es el coche. → Harness Engineering

Sesión y estado — Lo que persiste entre pasos y entre conversaciones: historial, variables, resultados de tools. Sin estado, el agente empieza de cero cada vez.

Memoria — Lo que el agente conserva a largo plazo y decide recordar (preferencias, decisiones pasadas). Distinta del contexto: la memoria se guarda, el contexto se arma.

Compaction — Resumir y recortar el historial cuando la ventana se llena, conservando lo esencial. Sin esto, el agente "olvida" lo del paso 3. → Context engineering práctico

Sandbox — El entorno aislado donde el agente ejecuta código o comandos, para que un error no toque producción ni tus archivos.

Guardrails — Las barreras que impiden acciones peligrosas: permisos por tool, clasificadores que revisan antes de ejecutar, límites de gasto. → Guardrails: permisos, sandbox y clasificadores

Inferencia

Inferencia — Ejecutar el modelo para obtener una respuesta. Entrenar es escribir el modelo; inferir es usarlo. Es la parte que pagas, mides y optimizas. → Inference Engineering: qué es

TTFT (Time To First Token) — Cuánto tarda en salir el primer token. Es la métrica que siente el usuario cuando escribe en un chat.

Tokens/s — Velocidad de generación. Un modelo que genera 80 tokens/s se siente fluido; uno a 15, lento.

Batching — Procesar varias peticiones juntas para aprovechar la GPU. Sube el throughput y, mal configurado, sube también la latencia. → Servir en producción

VRAM — La memoria de la GPU. Determina qué modelos caben y con cuánto contexto. La cuenta es: pesos + caché de contexto + overhead.

Cuantización — Guardar los pesos con menos precisión (4 u 8 bits) para que el modelo ocupe menos VRAM, a cambio de algo de calidad y velocidad. → Cuantización con números

Medir

Evals — Pruebas automáticas que miden si tu sistema mejoró o empeoró. Sin evals, cada cambio es una opinión. → Evals: los 3 tipos

Trazas (observabilidad) — El registro de cada paso del agente: prompt, tool, resultado, costo, latencia. Es la diferencia entre "falló el modelo" y saber qué falló. → Observabilidad y trazas

Cómo usar este diccionario

Si vienes de desarrollo web, el orden natural es: base → construir → agentes → inferencia → medir. Si vienes de datos, empieza por agentes. Y si solo querías entender una palabra en una conversación ajena, ya la tienes.

Los enlaces apuntan a los posts donde cada término se vuelve práctica, con mediciones y código. Este diccionario se actualiza cada vez que el vocabulario cambia, así que si ves un término nuevo en una charla y aquí no está, cuéntame y lo agrego.

Referencias

> More posts