Saltar al contenido
AI•3 min de lectura

Fine-tuning vs RAG vs prompting: cuándo cada uno

Cada pocas semanas alguien me dice que va a hacer fine-tuning. Casi nunca es lo que necesita: el 90% de los problemas que se atribuyen a "el modelo no sabe" se resuelven con mejor contexto o mejores instrucciones. Esta pieza es la escalera completa, con los números del fine-tuning.

La escalera (y por qué el orden importa)

  1. Prompt: instrucciones y ejemplos en el propio prompt. Barato, inmediato, reversible.
  2. Contexto (RAG): dale el conocimiento que le falta, recuperado de tus documentos. Barato de mantener, actualizable.
  3. Fine-tuning: reentrenar el modelo con tus datos para cambiar su comportamiento. Caro, lento, difícil de revertir.

Se sube un escalón solo cuando el anterior demuestra que no alcanza, y se demuestra con evals, no con la sensación.

Qué resuelve cada uno

Quieres…Herramienta
Que siga un formato o tonoPrompt
Que conozca tus datos actuales y privadosRAG
Que se comporte distinto (estilo, formato complejo, tarea muy repetitiva)Fine-tuning
Reducir costo/latencia con un modelo chico que haga lo mismoFine-tuning (destilación)

La confusión clásica: usar fine-tuning para meter conocimiento. Eso es lo que hace RAG, y hacerlo con fine-tuning es caro, se desactualiza y suele empeorar el resultado. → RAG que funciona

Cuándo SÍ tiene sentido el fine-tuning

  • Formato muy específico y repetitivo que no cabe cómodo en el prompt (esquemas propios, plantillas rígidas).
  • Costo y latencia: un modelo especializado suele ser más chico y más rápido que uno general, y por eso conviene. - Source: 5 Questions To Ask Before Choosing An LLM - AI Hero
  • Estilo consistente en volúmenes grandes (voz de marca, respuestas de soporte).
  • Destilación: usar un modelo grande para generar datos y entrenar uno chico que lo imite en una tarea acotada.

Los costos reales

El trabajo de QLoRA documenta lo que cuesta hoy afinar modelos grandes: 33B en una sola GPU de 24 GB y 65B en una de 46 GB, entrenando solo adaptadores (LoRA) sobre el modelo congelado. - Source: Making LLMs even more accessible with bitsandbytes, 4-bit quantization and QLoRA - Hugging Face

Y un detalle técnico útil: "no es posible hacer entrenamiento puro en 4 bits"; se usan técnicas de ajuste eficiente de parámetros (PEFT) con adaptadores sobre el modelo cuantizado. - Source: Hugging Face

Los costos que no aparecen en la tabla:

  • Curar el dataset: es el 80% del trabajo real y lo más caro en tiempo.
  • Evals: sin una suite, no sabrás si mejoró o solo memorizó.
  • Mantenimiento: cada vez que cambian tus necesidades, vuelves a entrenar.

Los riesgos

  1. Olvido catastrófico: al especializar, el modelo puede empeorar en lo que ya hacía bien. Se detecta con evals que cubran también lo general.
  2. Overfitting a tu dataset: brillante en los ejemplos de entrenamiento, frágil fuera de ellos.
  3. Dataset desactualizado: el conocimiento se queda congelado en la fecha de los datos; el RAG se actualiza, el fine-tuning no.

Cómo decidir (5 preguntas)

  1. ¿Es conocimiento o comportamiento? Conocimiento → RAG. Comportamiento → sigue.
  2. ¿Lo resolvió ya un prompt con ejemplos? Si no lo intentaste, no lo sabes.
  3. ¿El formato es tan raro que el prompt se vuelve inmanejable? Entonces sí.
  4. ¿Necesitas bajar costo/latencia con un modelo más chico? Destilación.
  5. ¿Tienes dataset curado y evals? Sin las dos, el fine-tuning es una apuesta.

Y el recordatorio de siempre: empieza por lo simple y sube de complejidad solo cuando mejore el resultado. - Source: Building effective agents - Anthropic

El resto del camino, en RAG que funciona, Elegir modelo en 2026 y la guía AI Engineering.

¿Has hecho fine-tuning alguna vez? Cuéntame en los comentarios si era realmente necesario o si un prompt mejor lo hubiera resuelto.

Referencias

> Más posts