Choosing a model in 2026: 5 questions (and the new decision category)
No existe "el mejor modelo". Existe el modelo que responde estas cinco preguntas con tus datos. Y en 2026 apareció una sexta pregunta que cambia el juego: no siempre necesitas un modelo que escriba.
1. ¿Abierto o cerrado?
- Abierto: descargas los pesos y lo corres (tu hardware o la nube). Control total, incluida la privacidad y la residencia de datos; el costo pasa a ser tu hardware y tu tiempo.
- Cerrado: lo usan por API, hospedado por la empresa. Menos operación; pagas por uso.
Y hay que distinguir dos tipos de empresas: los proveedores de modelo (modelos cerrados: OpenAI, Google, Anthropic…) y los proveedores de API que hospedan modelos abiertos (Hugging Face, Groq…). - Source: 5 Questions To Ask Before Choosing An LLM - AI Hero
El consejo del artículo es el que sigo: empieza con APIs de terceros (máxima flexibilidad y costo razonable) y muévete a self-host solo si lo necesitas. - Source: 5 Questions To Ask Before Choosing An LLM - AI Hero
2. ¿Cuánto cuesta?
Se compara en costo por millón de tokens, separando entrada y salida. Rango real del mismo proveedor: de $1/$5 (Haiku 4.5) a $10/$50 (Fable 5.1) por MTok. - Source: Pricing - Anthropic
Un factor 10x no es un detalle de optimización: es la viabilidad del feature. Herramientas como el comparador de costos de Helicone ayudan a barrer el mercado. - Source: 5 Questions To Ask Before Choosing An LLM - AI Hero
3. ¿Cuánta latencia toleras?
Dos métricas: TTFT (primer token) y TPOT (por token). Y un trade-off que no se puede evitar: los modelos más chicos son más rápidos y suelen ser menos precisos; el hardware y las optimizaciones (cuantización, paralelismo) también mueven el número. - Source: 5 Questions To Ask Before Choosing An LLM - AI Hero
4. ¿Rinde en TU tarea?
Los benchmarks públicos son un indicador temprano, no un veredicto. El artículo lo advierte: existe el riesgo constante de que los proveedores ajusten sus modelos a los benchmarks (por contaminación en el preentrenamiento o por presión de mejorar la puntuación). - Source: 5 Questions To Ask Before Choosing An LLM - AI Hero
Dos matices útiles:
- Modelos especializados: si tu tarea es traducción, clasificación o código, un modelo especializado suele ganarle a uno general y además es más chico y rápido.
- Modelos de razonamiento: piensan antes de responder, ganan en planificación y matemática, y cuestan más latencia y dinero.
Y la conclusión inapelable: "la única forma de evaluar de verdad un modelo es probarlo en el contexto de tu aplicación". Eso son evals. - Source: 5 Questions To Ask Before Choosing An LLM - AI Hero
5. ¿Cuánto contexto necesitas?
La ventana de contexto cuenta entrada y salida, y pasarse produce error (o silencio). Gestionarla es una batalla constante: de ahí patrones como el chunking en RAG. → RAG que funciona
La categoría nueva: modelos de decisión
En 2026 dejó de ser cierto que "modelo" = "modelo que escribe". Existen modelos System One: no generan texto, evalúan un estado y devuelven decisiones tipadas con probabilidad. El caso publicado es Jev (TypeSafe AI): hasta 200x más rápido y 400x más barato que LLMs comparables en tareas de clasificación, usado para enrutar peticiones y bloquear acciones peligrosas antes de ejecutarlas. - Source: Building a Harness with Jev - Sydney Runkle / LangChain
Implicación: ya no eliges un modelo. Eliges un par: uno que genera (el caro) y otro que decide (el barato). Eso baja la factura y sube la velocidad. → Model routing y costos
Mi orden para decidir
- Empieza con APIs cerradas y dos modelos de proveedores distintos.
- Define tu presupuesto por usuario/mes antes de enamorarte de un modelo.
- Mide latencia en tu app (TTFT/TPOT con tus prompts).
- Escribe evals y compara candidatos contra tu tarea real.
- Añade un modelo de decisión cuando el routing por reglas se quede corto.
Todo el contexto está en el diccionario y la guía AI Engineering.
¿Cómo elegiste tu modelo actual: por benchmark, por precio o por evals? Cuéntame en los comentarios qué te hizo cambiar de opinión.