El ajuste fino (fine-tuning), la generación aumentada por recuperación (RAG) y el uso de prompts simples (prompting) resuelven cada uno una clase diferente de problemas para los modelos de lenguaje extensos (LLMs). Elegir el incorrecto desperdicia ciclos de GPU, infla las facturas de la nube y, aun así, deja a los usuarios con respuestas incorrectas. A continuación, se presenta un marco de trabajo paso a paso que permite a los desarrolladores decidir qué herramienta se adapta a su caso de uso y cómo combinarlas cuando surja la necesidad.

Las tres palancas

Qué cambia Cómo funciona Uso típico
RAG Añade hechos externos al contexto del modelo en el momento de la inferencia Actualizar precios, extraer los documentos de políticas más recientes, citar datos privados
Fine-tuning Ajusta los pesos internos del modelo para alterar el estilo, el formato o el comportamiento repetible Tono consistente, estructuras de salida complejas, clasificación de alto rendimiento
Prompting Moldea la respuesta inmediata del modelo con instrucciones y ejemplos claros Razonamiento general, prototipos rápidos, lanzar una funcionalidad en pocos días

La pregunta fundamental que debe hacerse al inicio de cualquier proyecto es: ¿La deficiencia es una brecha de conocimiento o una brecha de comportamiento? Una brecha de conocimiento significa que el modelo simplemente no tiene los hechos correctos; una brecha de comportamiento significa que conoce los hechos pero no los expresa de la manera que necesitas.

Cuando el problema es una brecha de conocimiento: recurre a RAG

Si el modelo alucina, devuelve números desactualizados o no puede señalar una fuente, el problema es la falta de información o que esta es obsoleta. RAG resuelve esto extrayendo el documento o el punto de datos correcto hacia el prompt en tiempo de ejecución.

  • Usa RAG cuando los hechos cambien con frecuencia; piensa en niveles de inventario, precios de mercado o tablas regulatorias.
  • Úsalo cuando debas proporcionar citas o trazabilidad para fines de cumplimiento o auditoría.
  • Úsalo para corpus privados que no pueden exponerse a un modelo público; la capa de recuperación mantiene los datos detrás de tu firewall.

Actualizar un documento es fácil. Reentrenar un modelo es difícil.

Cuando el problema es una brecha de comportamiento: realiza fine-tuning

Si el modelo ya conoce los hechos correctos pero los entrega en el formato o tono incorrectos, o con una estructura inconsistente, necesitas moldear su comportamiento interno. El fine-tuning reescribe los pesos del modelo para que el estilo deseado se convierta en el predeterminado.

  • Ideal para la voz específica de una marca, lenguaje legal o cualquier salida que deba seguir una plantilla estricta.
  • Funciona bien para tareas repetitivas de alto volumen, como la clasificación masiva, donde un pequeño costo de prompt por llamada se acumula.
  • Puede acortar los prompts, reduciendo el uso de tokens y, por lo tanto, el costo de inferencia.

Un error común es realizar fine-tuning en un modelo solo para enseñarle hechos. Eso desperdicia capacidad de cómputo y aún deja al modelo vulnerable a la deriva de datos (data drift) futura. Los hechos pertenecen a una capa de recuperación; el fine-tuning pertenece a la capa de comportamiento.

Cuando el problema es una brecha de instrucciones: comienza con el prompting

La ingeniería de prompts (prompt engineering) es la forma más barata y rápida de probar si el modelo puede resolver una tarea. Instrucciones claras, ejemplos de pocos disparos (few-shot) y el uso de prompting de cadena de pensamiento (chain-of-thought) a menudo cierran la brecha sin necesidad de realizar cambios en el modelo.

  • Úsalo para explorar cómo es una respuesta "buena" antes de comprometerte con una solución más costosa.
  • Aplícalo a tareas con mucha carga de razonamiento, lluvia de ideas o cualquier escenario donde necesites una respuesta rápida.
  • Si puedes obtener resultados satisfactorios con un prompt bien elaborado, evitarás la sobrecarga de la recolección de datos, el entrenamiento del modelo o los pipelines de recuperación.

Si no has agotado el uso de prompts claros y algunos ejemplos, no estás listo para invertir en infraestructura de fine-tuning o RAG.

Flujo de decisión

Pasa tu caso de uso por la siguiente lista de verificación. Detente en el primer "sí" y aplica esa técnica. Si se aplica más de una condición, combina las soluciones.

  1. ¿Has probado el prompting con instrucciones explícitas y ejemplos few-shot? No → comienza con el prompting.
  2. ¿El fallo se debe a la falta de hechos o a hechos desactualizados, o necesitas citar fuentes? → añade una capa de RAG.
  3. ¿El fallo se debe a un estilo o formato inconsistente, o a la necesidad de una salida repetible y de alto rendimiento? → realiza fine-tuning al modelo.

Cuando existan tanto brechas de conocimiento como de comportamiento, combina RAG y fine-tuning: recupera primero los hechos correctos y luego deja que el modelo con fine-tuning los presente con el estilo deseado.

Midiendo el éxito

Nunca te fíes de las "sensaciones". Crea un conjunto de evaluación pequeño y representativo que capture las entradas principales y los resultados esperados. Ejecuta el mismo conjunto en cada solución candidata: solo prompt, prompt + RAG, prompt + fine-tuning o el stack completo. Compara la precisión, la calidad de las citas, el coste de los tokens y la latencia. Los datos te dirán qué capa aporta valor real y cuál es una sobrecarga innecesaria.

Elegir la palanca adecuada desde el principio ahorra tiempo, dinero y frustración. Empieza con el prompt, añade recuperación (retrieval) cuando los hechos sean el cuello de botella, y realiza un fine-tuning cuando lo sea el comportamiento. Mide, itera y evitarás el error común de desperdiciar potencia de GPU en el problema equivocado.