Un modelo que memoriza no es inteligente
Un modelo con fine-tuning que repite tus ejemplos de entrenamiento palabra por palabra parece impresionante durante unos cinco segundos — justo hasta que te das cuenta de que no puede hacer nada más. Eso no es aprender, es memorizar, y es uno de los modos de falla más comunes en el fine-tuning: entrenar demasiadas pasadas sobre los mismos datos.
Por qué más épocas no es automáticamente mejor
Cada pasada completa sobre tu conjunto de entrenamiento es una época. Las primeras épocas le enseñan al modelo la forma general de la tarea — el estilo, la estructura, el tipo de respuesta que quieres. Pero si sigues corriendo épocas adicionales sobre el mismo conjunto de datos fijo, en algún momento el modelo deja de aprender el patrón y empieza a aprender los ejemplos específicos. Eso es sobreajuste: tu pérdida de entrenamiento sigue bajando, pero esa caída ya no refleja que el modelo mejore en la tarea en general — refleja que el modelo mejora en recordar exactamente lo que ya vio.
Por eso perseguir la menor pérdida de entrenamiento posible es el objetivo equivocado. Baja la pérdida de entrenamiento lo suficiente y ya no estás midiendo generalización — estás midiendo qué tan bien el modelo ha memorizado su conjunto de entrenamiento, lo cual no te dice nada sobre cómo se desempeñará ante un prompt que no ha visto.
Cómo leer la curva de pérdida
La señal a observar es la forma, no solo la dirección. En una corrida de entrenamiento normal la pérdida baja rápido al principio y luego se aplana a medida que el modelo converge en el patrón general. El sobreajuste aparece como un segundo acto: la pérdida, tras aplanarse o tocar fondo, empieza a subir de nuevo (cuando se mide sobre datos apartados) o la pérdida de entrenamiento sigue cayendo mientras la calidad sobre cualquier cosa fuera del conjunto de entrenamiento empeora. Ese giro hacia arriba — o esa brecha creciente entre el desempeño en entrenamiento y en datos apartados — es tu señal de parada, no un número que debas superar a la fuerza.
Cómo hacerlo en la práctica
- Empieza con un presupuesto pequeño de épocas. La mayoría de los trabajos de fine-tuning solo necesitan aproximadamente una a tres épocas sobre los datos — trata los números mayores como la excepción, no como el valor por defecto.
- Guarda un checkpoint después de cada época. No esperes a que termine la corrida para descubrir que te pasaste.
- Aparta una porción de los datos del entrenamiento. Nunca entrenes sobre el 100% de lo que tienes; deja suficiente a un lado para poder probar la generalización de verdad.
- Evalúa cada checkpoint sobre los datos apartados, no sobre ejemplos que el modelo ya memorizó. Un modelo que puntúa perfecto sobre su propio conjunto de entrenamiento no te dice nada.
- Detente en el checkpoint anterior a que el desempeño sobre los datos apartados empiece a caer — eso suele ser entre una y tres épocas, pero la curva de pérdida es la autoridad real, no una regla fija.
epochs: 1–3, checkpoint each
Errores comunes
- Juzgar la calidad solo por la pérdida de entrenamiento. Una pérdida de entrenamiento que baja de forma sostenida al final de una corrida suele ser una señal de alarma, no una métrica de éxito — puede significar que el modelo está recitando, no aprendiendo.
- Probar solo con datos de entrenamiento. Si cada ejemplo con el que verificas el modelo también estaba en su conjunto de entrenamiento, no tienes forma de detectar el sobreajuste; solo estás confirmando la memorización.
- Usar un número fijo de épocas sin importar el tamaño del conjunto de datos. Los conjuntos pequeños se sobreajustan más rápido — a veces dentro de una sola época — porque hay menos ejemplos únicos sobre los cuales generalizar. Los conjuntos más grandes y variados pueden tolerar más pasadas antes de que pase lo mismo.
- No guardar checkpoints. Sin checkpoints por época, descubrir que te sobreajustaste significa reiniciar toda la corrida en lugar de simplemente volver al último checkpoint bueno.
Recursos
¿Estás afinando un modelo para producción? Yeda AI diseña, audita y lleva a producción sistemas LLM.