Fine-tuning vs RAG vs prompting: when to use each
Cada pocas semanas alguien me dice que va a hacer fine-tuning. Casi nunca es lo que necesita: el 90% de los problemas que se atribuyen a "el modelo no sabe" se resuelven con mejor contexto o mejores instrucciones. Esta pieza es la escalera completa, con los números del fine-tuning.
La escalera (y por qué el orden importa)
- Prompt: instrucciones y ejemplos en el propio prompt. Barato, inmediato, reversible.
- Contexto (RAG): dale el conocimiento que le falta, recuperado de tus documentos. Barato de mantener, actualizable.
- Fine-tuning: reentrenar el modelo con tus datos para cambiar su comportamiento. Caro, lento, difícil de revertir.
Se sube un escalón solo cuando el anterior demuestra que no alcanza, y se demuestra con evals, no con la sensación.
Qué resuelve cada uno
| Quieres… | Herramienta |
|---|---|
| Que siga un formato o tono | Prompt |
| Que conozca tus datos actuales y privados | RAG |
| Que se comporte distinto (estilo, formato complejo, tarea muy repetitiva) | Fine-tuning |
| Reducir costo/latencia con un modelo chico que haga lo mismo | Fine-tuning (destilación) |
La confusión clásica: usar fine-tuning para meter conocimiento. Eso es lo que hace RAG, y hacerlo con fine-tuning es caro, se desactualiza y suele empeorar el resultado. → RAG que funciona
Cuándo SÍ tiene sentido el fine-tuning
- Formato muy específico y repetitivo que no cabe cómodo en el prompt (esquemas propios, plantillas rígidas).
- Costo y latencia: un modelo especializado suele ser más chico y más rápido que uno general, y por eso conviene. - Source: 5 Questions To Ask Before Choosing An LLM - AI Hero
- Estilo consistente en volúmenes grandes (voz de marca, respuestas de soporte).
- Destilación: usar un modelo grande para generar datos y entrenar uno chico que lo imite en una tarea acotada.
Los costos reales
El trabajo de QLoRA documenta lo que cuesta hoy afinar modelos grandes: 33B en una sola GPU de 24 GB y 65B en una de 46 GB, entrenando solo adaptadores (LoRA) sobre el modelo congelado. - Source: Making LLMs even more accessible with bitsandbytes, 4-bit quantization and QLoRA - Hugging Face
Y un detalle técnico útil: "no es posible hacer entrenamiento puro en 4 bits"; se usan técnicas de ajuste eficiente de parámetros (PEFT) con adaptadores sobre el modelo cuantizado. - Source: Hugging Face
Los costos que no aparecen en la tabla:
- Curar el dataset: es el 80% del trabajo real y lo más caro en tiempo.
- Evals: sin una suite, no sabrás si mejoró o solo memorizó.
- Mantenimiento: cada vez que cambian tus necesidades, vuelves a entrenar.
Los riesgos
- Olvido catastrófico: al especializar, el modelo puede empeorar en lo que ya hacía bien. Se detecta con evals que cubran también lo general.
- Overfitting a tu dataset: brillante en los ejemplos de entrenamiento, frágil fuera de ellos.
- Dataset desactualizado: el conocimiento se queda congelado en la fecha de los datos; el RAG se actualiza, el fine-tuning no.
Cómo decidir (5 preguntas)
- ¿Es conocimiento o comportamiento? Conocimiento → RAG. Comportamiento → sigue.
- ¿Lo resolvió ya un prompt con ejemplos? Si no lo intentaste, no lo sabes.
- ¿El formato es tan raro que el prompt se vuelve inmanejable? Entonces sí.
- ¿Necesitas bajar costo/latencia con un modelo más chico? Destilación.
- ¿Tienes dataset curado y evals? Sin las dos, el fine-tuning es una apuesta.
Y el recordatorio de siempre: empieza por lo simple y sube de complejidad solo cuando mejore el resultado. - Source: Building effective agents - Anthropic
El resto del camino, en RAG que funciona, Elegir modelo en 2026 y la guía AI Engineering.
¿Has hecho fine-tuning alguna vez? Cuéntame en los comentarios si era realmente necesario o si un prompt mejor lo hubiera resuelto.