Fine-tuning es el ajuste adicional de un modelo preentrenado con un conjunto de ejemplos para adaptar su comportamiento a una tarea, formato o estilo. No equivale a actualizar una base de conocimiento y no garantiza que el modelo aprenda correctamente todos los datos entregados.
Qué problema intenta resolver
Puede ayudar a seguir un formato, reconocer categorías o mantener un estilo consistente cuando un prompt y ejemplos no bastan. Si el problema es información que cambia con frecuencia, recuperar documentos suele ser más apropiado que volver a entrenar.
Datos y preparación
Los ejemplos deben representar entradas reales, salidas deseadas y casos que no deben resolverse. Revisa calidad, duplicados, datos personales y distribución. Un conjunto pequeño pero coherente puede ser más útil que muchos ejemplos ruidosos.
Coste y evaluación
El ajuste requiere preparar datos, ejecutar un proceso y evaluar una versión. Conserva un conjunto de validación separado y compara con el modelo base. Comprueba precisión, formato, respuestas fuera de alcance, coste y latencia.
Fine-tuning frente a prompt y RAG
Un prompt cambia instrucciones en tiempo de ejecución. RAG aporta contexto externo actualizado. Fine-tuning modifica pesos y puede ser útil para comportamiento repetido, pero hace más difícil conocer por qué apareció una respuesta. Las técnicas pueden combinarse, aunque también aumentan operación.
Riesgos de sobreajuste
Si los ejemplos son escasos o demasiado uniformes, el modelo puede memorizar patrones y empeorar fuera de la muestra. Evalúa casos nuevos, idiomas y entradas ambiguas. Una mejora en ejemplos conocidos no demuestra generalización.
Publicar una versión ajustada
Versiona datos, configuración, pesos, métricas y permisos. Mantén una ruta para volver al modelo base y monitoriza respuestas después de publicar. No uses fine-tuning para conceder acciones: la autorización debe permanecer en la aplicación.
Cuándo no compensa
Si un prompt claro, una regla o una recuperación documental resuelve la necesidad, el ajuste añade coste sin beneficio suficiente. Decide con una evaluación y con la capacidad real del equipo para mantener nuevas versiones.
Separar conocimiento y comportamiento
Si los documentos cambian, entrenar de nuevo cada vez es una forma costosa de mantener información. Una fuente recuperable permite actualizar contenido sin modificar pesos. Fine-tuning resulta más adecuado para patrones estables de formato, estilo o clasificación.
Preparar ejemplos con cuidado
Elimina datos sensibles innecesarios, corrige contradicciones y marca casos fuera de alcance. Los ejemplos deben mostrar también cómo abstenerse. Un conjunto que siempre contiene una respuesta puede enseñar al modelo a responder incluso cuando falta información.
Evaluar fuera de la muestra
Divide datos de entrenamiento y validación, y conserva una prueba final que no se utilice para ajustar. Comprueba idiomas, longitudes, errores de entrada y solicitudes ambiguas. Compara con el modelo base y con una solución de prompt o recuperación.
Operar una nueva versión
Versiona dataset, código, configuración, pesos y métricas. Publica gradualmente, registra qué versión respondió y conserva una ruta de reversión. La autorización debe permanecer en la aplicación, aunque el modelo ajustado produzca salidas más consistentes.
Elegir la técnica adecuada
Prompting cambia instrucciones; recuperación aporta información externa; fine-tuning adapta un comportamiento estable. Si el contenido se actualiza diariamente, ajustar pesos puede crear retraso de mantenimiento. Si el formato es repetitivo y estable, el ajuste puede ser una opción después de medir.
Datos y riesgo
Revisa licencias, datos personales, duplicados y contradicciones. Incluye ejemplos de abstención y de entrada fuera de alcance. No entrenes una conducta insegura esperando que la aplicación la corrija después.
Versionar y comparar
Conserva dataset, configuración, pesos, evaluación y runtime. Compara con el modelo base en casos nuevos y mide coste, latencia y calidad. Publica gradualmente y mantén una reversión sencilla.
Casos fuera de muestra
Prueba idiomas, entradas largas, datos incompletos y solicitudes que deben rechazarse. Un modelo ajustado para ejemplos conocidos puede comportarse peor fuera de ellos.
Operación posterior
Registra versión de pesos, datos, runtime y resultados. Mantén una alternativa base y revisa el modelo cuando cambien los datos o la tarea.
Cuándo detener el ajuste
Si el modelo base con un prompt o recuperación ya responde a la necesidad, ajustar pesos puede añadir mantenimiento sin beneficio. Compara alternativas con casos nuevos y considera coste, latencia, calidad y capacidad de reversión.
La decisión debe quedar documentada.
Datos que cambian y datos estables
Los documentos que se actualizan con frecuencia suelen pertenecer a una fuente recuperable, no a los pesos. Fine-tuning encaja mejor con comportamiento, formato o clasificación relativamente estable.
Publicación y reversión
Guarda dataset, pesos, configuración, runtime y evaluación. Publica gradualmente y conserva el modelo base. Si la calidad cae fuera de los ejemplos conocidos, vuelve atrás y revisa los datos antes de ajustar otra vez.
Evaluación antes de publicar
Compara modelo base y ajustado con casos nuevos, ambiguos y fuera de alcance. Mide calidad, coste, latencia y formato. Una mejora en ejemplos conocidos no demuestra generalización.
Responsabilidad del sistema
La autorización debe permanecer en la aplicación. Un modelo ajustado puede producir un formato más consistente, pero no debe decidir por sí solo una acción sensible.
La reversión debe estar preparada antes de publicar. Versiona también los datos y la configuración, no solo los pesos.
La evaluación debe continuar después de la publicación, especialmente cuando cambia el tipo de entrada.

