Fine-tuning frente a RAG: cuándo necesitas de verdad hacer fine-tuning
Continuar el entrenamiento de un modelo con ejemplos del comportamiento que quieres, de modo que ese comportamiento pase a ser su comportamiento por defecto en lugar de algo que pides en cada petición. Cambia cómo funciona un modelo, no lo que sabe.
Solo hay tres maneras de cambiar lo que un modelo hace por ti, y no son intercambiables. Elegir la equivocada sale caro de un modo que solo se nota meses después.
| Palanca | Qué cambia | Cuándo te cuesta |
|---|---|---|
| Prompting | Lo que el modelo hace esta vez | En cada petición, en tokens — y las instrucciones largas se siguen con menos fiabilidad a medida que crece la conversación |
| Recuperación | Lo que el modelo sabe ahora mismo | Por petición, en trabajo de recuperación. Los hechos se mantienen al día porque viven fuera del modelo |
| Fine-tuning | Lo que el modelo hace por defecto | Una vez, por adelantado. Gratis en tiempo de petición — el comportamiento queda incorporado |
Qué es en realidad el fine-tuning
Tomas un modelo base y continúas su entrenamiento con ejemplos del comportamiento que quieres — pares de entrada y la respuesta que habría dado un buen profesional de tu campo. Los valores por defecto del modelo se desplazan — qué palabras elige, qué forma toma una respuesta, qué pregunta antes de responder.
No es una base de datos. No se almacena ni se consulta nada. Los ejemplos mueven las tendencias del modelo; no se convierten en hechos que pueda recitar.
En la práctica es un adaptador, no un modelo nuevo
Reentrenar cada peso es caro y rara vez necesario. El enfoque habitual — LoRA, o adaptación de bajo rango — entrena un pequeño conjunto de parámetros adicionales que se apoyan sobre un modelo base congelado. El resultado es un archivo de decenas de megabytes en lugar de decenas de gigabytes.
Eso tiene una consecuencia que conviene conocer: un mismo modelo base puede servir a muchos adaptadores. Una sola máquina puede ejecutar los mismos pesos base para un despacho de abogados, una clínica y un operador logístico, intercambiando un pequeño adaptador por tenant. Hacer fine-tuning por industria no significa un modelo entero por industria.
Cuándo lo necesitas de verdad
El registro importa y un prompt no puede sostenerlo. Los honoríficos empresariales japoneses, el lenguaje clínico, la forma en que un suscriptor de seguros matiza. Puedes describir el registro en un prompt; bajo una conversación larga el modelo vuelve a la deriva hacia sus valores por defecto. El fine-tuning mueve ese valor por defecto.
Cumplimiento de formato a escala. Si cada salida debe tener una estructura concreta y "casi siempre correcto" no es suficiente, los ejemplos lo enseñan con más fiabilidad que las instrucciones.
Las instrucciones han superado en tamaño a la respuesta. Cuando el prompt de sistema es más largo que lo que produce, estás pagando esos tokens en cada una de las peticiones. El fine-tuning es la forma de sacar ese coste de la ruta por petición.
Un modelo pequeño en un dominio estrecho. Un modelo pequeño bien afinado a menudo supera a uno general mucho mayor dentro de un oficio — lo que es tanto una decisión de coste como de calidad. Consulta trae tu propio modelo.
El modelo base es débil en tu idioma o tu campo. Algunos idiomas y especialidades escasean en los datos públicos de entrenamiento. Los ejemplos son la forma de solucionarlo.
Cuándo no lo necesitas
Los hechos no pertenecen a un fine-tune. Precios, políticas, disponibilidad, estado de un caso — cualquier cosa que pueda cambiar un martes pertenece a una base de conocimiento, donde cambiarlo es una subida de archivo. Un modelo afinado no se actualiza cuando lo hace tu lista de precios, y seguirá respondiendo con confianza con lo que aprendió.
- Aún no has probado un prompt mejor. La mayoría de los problemas de "necesitamos un modelo a medida" son problemas de prompt. El fine-tuning es la respuesta cara; gánatela primero.
- Tienes un puñado de ejemplos. Unas pocas docenas no moverán un modelo. Cientos de ellos buenos quizá sí; la calidad vence al volumen, y los ejemplos malos entrenan malos hábitos con fidelidad.
- Aquello que quieres cambia a menudo. Cualquier cosa que quisieras editar cada semana no debería quedar incorporada.
Qué hace falta para hacerlo bien
Ejemplos. De cientos a unos pocos miles, extraídos de trabajo real y revisados por alguien que conozca el campo. Esta es la parte que los clientes subestiman — la recopilación de datos suele ser más larga que el entrenamiento.
Un conjunto de evaluación reservado. Ejemplos que el modelo nunca vio, puntuados antes y después. Sin esto no puedes saber si el fine-tune ayudó, perjudicó o no hizo nada — y "parece mejor" no es una medición. Este es el paso que más se omite y el que decide si el proyecto mereció la pena.
Un plan para cuando cambie el modelo base. Los adaptadores están atados al base sobre el que se entrenaron. Cuando pasas a un modelo base más nuevo, el ajuste se rehace. Presupuéstalo como mantenimiento, no como algo de una sola vez.
El fallo contra el que hay que diseñar
Un modelo afinado con demasiada fuerza sobre un estilo estrecho empeora en todo lo demás — responde con la voz de tu casa incluso cuando la pregunta necesitaba otro registro, y se vuelve fluido y confiado sobre cosas que nunca se le enseñaron. Por eso importa el conjunto de evaluación, y por eso el objetivo sensato es normalmente un desplazamiento modesto de los valores por defecto en lugar de un modelo que solo sabe hacer una cosa.
La descripción permanente de quién es un agente — su carácter, su tono y sus reglas innegociables — mantenida aparte del trabajo que le toque hacer.
Los documentos desde los que un agente puede responder. agent4.io mantiene dos clases — el material revisado de tu empresa y los archivos propios de cada cliente — recuperados juntos pero nunca confundidos entre sí.
Un paquete de capacidad con nombre — una descripción breve de cuándo usarlo, instrucciones más extensas y las herramientas que desbloquea — que el agente carga solo cuando resulta pertinente.
El Model Context Protocol — un estándar abierto para conectar un agente con herramientas y datos externos, de modo que un sistema exponga sus capacidades una sola vez en lugar de una vez por cada producto de IA.
Tres trabajos distintos que suelen confundirse en uno — la base de conocimiento guarda hechos, una herramienta MCP ejecuta un cálculo que no puedes dejar que un modelo improvise, y una Skill es el procedimiento que decide a cuál recurrir.