Tu IA es lo que come: por qué la calidad de los datos le gana al tamaño
Aquí va un número que debería recalibrar cómo piensas sobre los datos de entrenamiento: según el material explicativo de fundamentos de IA de Meta, la tubería de un modelo de frontera puede partir de aproximadamente 3.000 billones de puntos de datos de texto recopilado y filtrarlo hasta unos 20 billones de tokens de datos de entrenamiento. Eso equivale a conservar cerca del 1% y descartar el resto. El paso más costoso al construir un modelo no es recopilar datos: es tirar la mayoría a la basura.
El filtro brutal
¿Por qué eliminar el 99% de lo que recopilaste? Porque los datos de entrenamiento tienen que satisfacer tres principios a la vez, y el texto crudo de internet falla en casi todos:
- Cantidad: los modelos necesitan volúmenes enormes de texto para aprender la estadística del lenguaje. Necesario, pero el más barato de satisfacer de los tres.
- Calidad: páginas duplicadas, spam, marcado roto, basura generada por máquinas y contenido factualmente incorrecto se filtran. Cada documento de baja calidad que sobrevive le enseña al modelo un mal patrón.
- Diversidad: los datos que sobreviven deben abarcar temas, idiomas, formatos y puntos de vista. Un billón de tokens de publicaciones de foro casi idénticas vale mucho menos que una mezcla más pequeña y más amplia.
La cantidad se lleva los titulares; la calidad y la diversidad hacen el trabajo. El filtro es donde queda fijado el techo del modelo.
Basura entra, basura sale
Piensa en el modelo como un rascacielos y en los datos de entrenamiento como el suelo sobre el que se construye. Puedes agregar pisos — más parámetros, más cómputo, entrenamientos más largos — pero si los cimientos son arena movediza, cada piso extra empeora el derrumbe en vez de mejorarlo. Un modelo más grande entrenado con datos ruidosos no promedia el ruido hasta hacerlo desaparecer; aprende el ruido con más fidelidad. Los errores, sesgos y patrones basura de los datos se convierten en errores, sesgos y patrones basura en las salidas. Ninguna cantidad de escala arregla unos cimientos malos.
La misma regla aplica a tus prompts
No controlas con qué fue entrenado un modelo, pero sí controlas el segundo conjunto de datos del que aprende: tu ventana de contexto. Todo lo que pegas — ejemplos, documentos, historial de chat — son datos sobre los que el modelo se condiciona, y aplica la misma matemática de cantidad/calidad/diversidad:
- Tres ejemplos excelentes y correctamente etiquetados le ganan a quince desprolijos e inconsistentes. Cada ejemplo defectuoso enseña un patrón defectuoso — dentro del contexto, al instante.
- Un documento limpio y relevante le gana a un volcado crudo de una wiki entera. El contexto irrelevante no solo desperdicia tokens; diluye activamente la señal a la que el modelo debería atender.
- El contexto contradictorio es arena movediza: si dos documentos pegados no concuerdan, el modelo puede construir con confianza sobre cualquiera de los dos.
Trucos avanzados
- Cura tus ejemplos. Antes de hacer prompting few-shot, revisa cada ejemplo como si fuera dato de entrenamiento — porque para el modelo lo es. Corrige etiquetas, elimina casos borde que no quieres que se copien.
- Poda el contexto irrelevante. Recorta todo lo que la tarea no necesita. Un prompt más corto y limpio suele rendir mejor que uno más largo y ruidoso.
- Prefiere las fuentes primarias. Pega la especificación real, la página de documentación o el log de error — no el resumen que hizo un colega. Calidad entra, calidad sale.
Recursos
- Blog de Meta AI — serie explicativa de fundamentos de IA
- Anthropic — introducción a la ingeniería de prompts
- Read this article in English
¿Estás construyendo una función con IA? Yeda AI diseña, audita y lanza sistemas LLM en producción.