Yeda AI Tips · #045

English

Un modelo que memoriza no es inteligente

Un modelo con fine-tuning que repite tus ejemplos de entrenamiento palabra por palabra parece impresionante durante unos cinco segundos — justo hasta que te das cuenta de que no puede hacer nada más. Eso no es aprender, es memorizar, y es uno de los modos de falla más comunes en el fine-tuning: entrenar demasiadas pasadas sobre los mismos datos.

Por qué más épocas no es automáticamente mejor

Cada pasada completa sobre tu conjunto de entrenamiento es una época. Las primeras épocas le enseñan al modelo la forma general de la tarea — el estilo, la estructura, el tipo de respuesta que quieres. Pero si sigues corriendo épocas adicionales sobre el mismo conjunto de datos fijo, en algún momento el modelo deja de aprender el patrón y empieza a aprender los ejemplos específicos. Eso es sobreajuste: tu pérdida de entrenamiento sigue bajando, pero esa caída ya no refleja que el modelo mejore en la tarea en general — refleja que el modelo mejora en recordar exactamente lo que ya vio.

Por eso perseguir la menor pérdida de entrenamiento posible es el objetivo equivocado. Baja la pérdida de entrenamiento lo suficiente y ya no estás midiendo generalización — estás midiendo qué tan bien el modelo ha memorizado su conjunto de entrenamiento, lo cual no te dice nada sobre cómo se desempeñará ante un prompt que no ha visto.

Cómo leer la curva de pérdida

La señal a observar es la forma, no solo la dirección. En una corrida de entrenamiento normal la pérdida baja rápido al principio y luego se aplana a medida que el modelo converge en el patrón general. El sobreajuste aparece como un segundo acto: la pérdida, tras aplanarse o tocar fondo, empieza a subir de nuevo (cuando se mide sobre datos apartados) o la pérdida de entrenamiento sigue cayendo mientras la calidad sobre cualquier cosa fuera del conjunto de entrenamiento empeora. Ese giro hacia arriba — o esa brecha creciente entre el desempeño en entrenamiento y en datos apartados — es tu señal de parada, no un número que debas superar a la fuerza.

Cómo hacerlo en la práctica

  1. Empieza con un presupuesto pequeño de épocas. La mayoría de los trabajos de fine-tuning solo necesitan aproximadamente una a tres épocas sobre los datos — trata los números mayores como la excepción, no como el valor por defecto.
  2. Guarda un checkpoint después de cada época. No esperes a que termine la corrida para descubrir que te pasaste.
  3. Aparta una porción de los datos del entrenamiento. Nunca entrenes sobre el 100% de lo que tienes; deja suficiente a un lado para poder probar la generalización de verdad.
  4. Evalúa cada checkpoint sobre los datos apartados, no sobre ejemplos que el modelo ya memorizó. Un modelo que puntúa perfecto sobre su propio conjunto de entrenamiento no te dice nada.
  5. Detente en el checkpoint anterior a que el desempeño sobre los datos apartados empiece a caer — eso suele ser entre una y tres épocas, pero la curva de pérdida es la autoridad real, no una regla fija.
epochs: 1–3, checkpoint each

Errores comunes

Recursos

¿Estás afinando un modelo para producción? Yeda AI diseña, audita y lleva a producción sistemas LLM.

Habla con nosotros · Lee el blog