Yeda AI Tips · #007

English

Tu IA es lo que come: por qué la calidad de los datos le gana al tamaño

Aquí va un número que debería recalibrar cómo piensas sobre los datos de entrenamiento: según el material explicativo de fundamentos de IA de Meta, la tubería de un modelo de frontera puede partir de aproximadamente 3.000 billones de puntos de datos de texto recopilado y filtrarlo hasta unos 20 billones de tokens de datos de entrenamiento. Eso equivale a conservar cerca del 1% y descartar el resto. El paso más costoso al construir un modelo no es recopilar datos: es tirar la mayoría a la basura.

El filtro brutal

¿Por qué eliminar el 99% de lo que recopilaste? Porque los datos de entrenamiento tienen que satisfacer tres principios a la vez, y el texto crudo de internet falla en casi todos:

  1. Cantidad: los modelos necesitan volúmenes enormes de texto para aprender la estadística del lenguaje. Necesario, pero el más barato de satisfacer de los tres.
  2. Calidad: páginas duplicadas, spam, marcado roto, basura generada por máquinas y contenido factualmente incorrecto se filtran. Cada documento de baja calidad que sobrevive le enseña al modelo un mal patrón.
  3. Diversidad: los datos que sobreviven deben abarcar temas, idiomas, formatos y puntos de vista. Un billón de tokens de publicaciones de foro casi idénticas vale mucho menos que una mezcla más pequeña y más amplia.

La cantidad se lleva los titulares; la calidad y la diversidad hacen el trabajo. El filtro es donde queda fijado el techo del modelo.

Basura entra, basura sale

Piensa en el modelo como un rascacielos y en los datos de entrenamiento como el suelo sobre el que se construye. Puedes agregar pisos — más parámetros, más cómputo, entrenamientos más largos — pero si los cimientos son arena movediza, cada piso extra empeora el derrumbe en vez de mejorarlo. Un modelo más grande entrenado con datos ruidosos no promedia el ruido hasta hacerlo desaparecer; aprende el ruido con más fidelidad. Los errores, sesgos y patrones basura de los datos se convierten en errores, sesgos y patrones basura en las salidas. Ninguna cantidad de escala arregla unos cimientos malos.

La misma regla aplica a tus prompts

No controlas con qué fue entrenado un modelo, pero sí controlas el segundo conjunto de datos del que aprende: tu ventana de contexto. Todo lo que pegas — ejemplos, documentos, historial de chat — son datos sobre los que el modelo se condiciona, y aplica la misma matemática de cantidad/calidad/diversidad:

Trucos avanzados

Recursos

¿Estás construyendo una función con IA? Yeda AI diseña, audita y lanza sistemas LLM en producción.

Hablemos · Lee el blog