Fine-Tuning
Cuándo adaptar un modelo en lugar de usar prompts, y cómo hacerlo sin agotar el presupuesto de GPU.
Congela el modelo, entrena el adaptador: cómo LoRA y QLoRA reducen la memoria del fine-tuning
LoRA congela los pesos de un modelo base y en su lugar entrena dos pequeñas matrices adaptadoras — aquí explicamos por qué eso reduce drásticamente la memoria de GPU para el fine-tuning sin sacrificar mucha calidad, y cómo QLoRA lo lleva aún más lejos.
Tip #044Formato basura entra, respuestas basura salen: iguala la plantilla de chat antes de hacer fine-tuning
Un fine-tune que responde con texto roto y tokens sueltos casi nunca es un problema de datos: es un desajuste en la plantilla de chat. Aquí explicamos qué es una plantilla de chat y cómo aplicar la correcta antes de entrenar.
Tip #045Un modelo que memoriza no es inteligente: observa la curva de pérdida para detener el sobreajuste
Entrena un fine-tune durante demasiadas épocas y dejará de generalizar para empezar a recitar tus datos de entrenamiento. Así se lee la curva de pérdida y se limita el número de épocas antes de que eso pase.