Yeda AI Tips · #048

English

Chatea con tus propios archivos, de forma local: RAG en palabras simples

Pregúntale a un modelo local genérico "¿qué hice en Tokio?" y no tendrá nada que decir — nunca ha visto tus notas, tu diario ni tus archivos. Es lo esperable: un modelo solo sabe aquello con lo que fue entrenado. La solución no es reentrenar el modelo. Es darle tus archivos para que los busque antes de responder — una técnica llamada RAG.

El problema: los modelos no conocen tus cosas

El conocimiento de un modelo de I.A. queda congelado en el momento del entrenamiento y se limita a datos públicos. No tiene idea de lo que hay en tus notas personales, en la documentación interna de tu equipo o en los archivos de tu proyecto, a menos que le pongas ese contenido delante. Pegar un documento en cada chat funciona para una pregunta, pero no escala a una carpeta con cientos de archivos, y no persiste entre sesiones.

Por qué funciona RAG

RAG significa Retrieval-Augmented Generation (generación aumentada por recuperación). En lugar de reentrenar el modelo con tus documentos (lento, caro y no es lo que la mayoría necesita), tus archivos se indexan — se dividen en fragmentos y se almacenan para poder buscarlos. Cuando haces una pregunta, la aplicación primero busca en ese índice los fragmentos más relevantes de tus propios archivos y luego se los entrega al modelo junto con tu pregunta. El modelo responde usando lo que acaba de recuperar, no desde su memoria. Esa es toda la idea: buscarlo primero, y luego responder, cada vez.

Cómo hacerlo

  1. Elige una interfaz de chat local que admita documentos. Open WebUI (que suele combinarse con Ollama) es una opción muy usada que agrega una capa de documentos/RAG sobre un modelo local.
  2. Agrega tus documentos. Sube una carpeta de notas, PDFs o archivos de texto a la aplicación. Los indexa en segundo plano — es un paso único por documento, no algo que repitas en cada pregunta.
  3. Haz una pregunta real sobre tu propio contenido. Por ejemplo: "¿Qué hice en Tokio?" La aplicación busca en tus archivos indexados cualquier cosa relevante, extrae los pasajes que coinciden y se los pasa al modelo junto con tu pregunta.
  4. Obtén una respuesta fundamentada. Como el modelo responde a partir de tus notas reales en vez de adivinar, la respuesta refleja lo que realmente escribiste — no una respuesta genérica e inventada.
  5. Sin reentrenamiento, sin fine-tuning. Agrega o quita documentos cuando quieras; el índice se actualiza y la siguiente pregunta busca en el conjunto actual de archivos.

Dónde encaja

Errores comunes

Trucos avanzados

Recursos

¿Estás construyendo una función de IA? Yeda AI diseña, audita y lanza sistemas LLM en producción.

Hablemos · Lee el blog