Conceptos

Fine-tuning frente a RAG: cuándo necesitas de verdad hacer fine-tuning

Continuar el entrenamiento de un modelo con ejemplos del comportamiento que quieres, de modo que ese comportamiento pase a ser su comportamiento por defecto en lugar de algo que pides en cada petición. Cambia cómo funciona un modelo, no lo que sabe.

También llamadoLoRAadaptadoradaptación de dominiomodelo a medidaentrenamiento de modeloscustom modelmodel training

Solo hay tres maneras de cambiar lo que un modelo hace por ti, y no son intercambiables. Elegir la equivocada sale caro de un modo que solo se nota meses después.

fine-tuning
example behavioursModeltrained on theexamplesthat’s the default now
Fine-tuning bakes a behaviour into the model itself, instead of asking for it every request.
PalancaQué cambiaCuándo te cuesta
PromptingLo que el modelo hace esta vezEn cada petición, en tokens — y las instrucciones largas se siguen con menos fiabilidad a medida que crece la conversación
RecuperaciónLo que el modelo sabe ahora mismoPor petición, en trabajo de recuperación. Los hechos se mantienen al día porque viven fuera del modelo
Fine-tuningLo que el modelo hace por defectoUna vez, por adelantado. Gratis en tiempo de petición — el comportamiento queda incorporado

Qué es en realidad el fine-tuning

Tomas un modelo base y continúas su entrenamiento con ejemplos del comportamiento que quieres — pares de entrada y la respuesta que habría dado un buen profesional de tu campo. Los valores por defecto del modelo se desplazan — qué palabras elige, qué forma toma una respuesta, qué pregunta antes de responder.

No es una base de datos. No se almacena ni se consulta nada. Los ejemplos mueven las tendencias del modelo; no se convierten en hechos que pueda recitar.

En la práctica es un adaptador, no un modelo nuevo

Reentrenar cada peso es caro y rara vez necesario. El enfoque habitual — LoRA, o adaptación de bajo rango — entrena un pequeño conjunto de parámetros adicionales que se apoyan sobre un modelo base congelado. El resultado es un archivo de decenas de megabytes en lugar de decenas de gigabytes.

Eso tiene una consecuencia que conviene conocer: un mismo modelo base puede servir a muchos adaptadores. Una sola máquina puede ejecutar los mismos pesos base para un despacho de abogados, una clínica y un operador logístico, intercambiando un pequeño adaptador por tenant. Hacer fine-tuning por industria no significa un modelo entero por industria.

Cuándo lo necesitas de verdad

El registro importa y un prompt no puede sostenerlo. Los honoríficos empresariales japoneses, el lenguaje clínico, la forma en que un suscriptor de seguros matiza. Puedes describir el registro en un prompt; bajo una conversación larga el modelo vuelve a la deriva hacia sus valores por defecto. El fine-tuning mueve ese valor por defecto.

Cumplimiento de formato a escala. Si cada salida debe tener una estructura concreta y "casi siempre correcto" no es suficiente, los ejemplos lo enseñan con más fiabilidad que las instrucciones.

Las instrucciones han superado en tamaño a la respuesta. Cuando el prompt de sistema es más largo que lo que produce, estás pagando esos tokens en cada una de las peticiones. El fine-tuning es la forma de sacar ese coste de la ruta por petición.

Un modelo pequeño en un dominio estrecho. Un modelo pequeño bien afinado a menudo supera a uno general mucho mayor dentro de un oficio — lo que es tanto una decisión de coste como de calidad. Consulta trae tu propio modelo.

El modelo base es débil en tu idioma o tu campo. Algunos idiomas y especialidades escasean en los datos públicos de entrenamiento. Los ejemplos son la forma de solucionarlo.

Cuándo no lo necesitas

Los hechos no pertenecen a un fine-tune. Precios, políticas, disponibilidad, estado de un caso — cualquier cosa que pueda cambiar un martes pertenece a una base de conocimiento, donde cambiarlo es una subida de archivo. Un modelo afinado no se actualiza cuando lo hace tu lista de precios, y seguirá respondiendo con confianza con lo que aprendió.

  • Aún no has probado un prompt mejor. La mayoría de los problemas de "necesitamos un modelo a medida" son problemas de prompt. El fine-tuning es la respuesta cara; gánatela primero.
  • Tienes un puñado de ejemplos. Unas pocas docenas no moverán un modelo. Cientos de ellos buenos quizá sí; la calidad vence al volumen, y los ejemplos malos entrenan malos hábitos con fidelidad.
  • Aquello que quieres cambia a menudo. Cualquier cosa que quisieras editar cada semana no debería quedar incorporada.

Qué hace falta para hacerlo bien

Ejemplos. De cientos a unos pocos miles, extraídos de trabajo real y revisados por alguien que conozca el campo. Esta es la parte que los clientes subestiman — la recopilación de datos suele ser más larga que el entrenamiento.

Un conjunto de evaluación reservado. Ejemplos que el modelo nunca vio, puntuados antes y después. Sin esto no puedes saber si el fine-tune ayudó, perjudicó o no hizo nada — y "parece mejor" no es una medición. Este es el paso que más se omite y el que decide si el proyecto mereció la pena.

Un plan para cuando cambie el modelo base. Los adaptadores están atados al base sobre el que se entrenaron. Cuando pasas a un modelo base más nuevo, el ajuste se rehace. Presupuéstalo como mantenimiento, no como algo de una sola vez.

El fallo contra el que hay que diseñar

Un modelo afinado con demasiada fuerza sobre un estilo estrecho empeora en todo lo demás — responde con la voz de tu casa incluso cuando la pregunta necesitaba otro registro, y se vuelve fluido y confiado sobre cosas que nunca se le enseñaron. Por eso importa el conjunto de evaluación, y por eso el objetivo sensato es normalmente un desplazamiento modesto de los valores por defecto en lugar de un modelo que solo sabe hacer una cosa.

¿Quieres ver cómo funciona por dentro?Por qué el modelo es una pieza intercambiable