Chatea con tus propios archivos, de forma local: RAG en palabras simples
Pregúntale a un modelo local genérico "¿qué hice en Tokio?" y no tendrá nada que decir — nunca ha visto tus notas, tu diario ni tus archivos. Es lo esperable: un modelo solo sabe aquello con lo que fue entrenado. La solución no es reentrenar el modelo. Es darle tus archivos para que los busque antes de responder — una técnica llamada RAG.
El problema: los modelos no conocen tus cosas
El conocimiento de un modelo de I.A. queda congelado en el momento del entrenamiento y se limita a datos públicos. No tiene idea de lo que hay en tus notas personales, en la documentación interna de tu equipo o en los archivos de tu proyecto, a menos que le pongas ese contenido delante. Pegar un documento en cada chat funciona para una pregunta, pero no escala a una carpeta con cientos de archivos, y no persiste entre sesiones.
Por qué funciona RAG
RAG significa Retrieval-Augmented Generation (generación aumentada por recuperación). En lugar de reentrenar el modelo con tus documentos (lento, caro y no es lo que la mayoría necesita), tus archivos se indexan — se dividen en fragmentos y se almacenan para poder buscarlos. Cuando haces una pregunta, la aplicación primero busca en ese índice los fragmentos más relevantes de tus propios archivos y luego se los entrega al modelo junto con tu pregunta. El modelo responde usando lo que acaba de recuperar, no desde su memoria. Esa es toda la idea: buscarlo primero, y luego responder, cada vez.
Cómo hacerlo
- Elige una interfaz de chat local que admita documentos. Open WebUI (que suele combinarse con Ollama) es una opción muy usada que agrega una capa de documentos/RAG sobre un modelo local.
- Agrega tus documentos. Sube una carpeta de notas, PDFs o archivos de texto a la aplicación. Los indexa en segundo plano — es un paso único por documento, no algo que repitas en cada pregunta.
- Haz una pregunta real sobre tu propio contenido. Por ejemplo: "¿Qué hice en Tokio?" La aplicación busca en tus archivos indexados cualquier cosa relevante, extrae los pasajes que coinciden y se los pasa al modelo junto con tu pregunta.
- Obtén una respuesta fundamentada. Como el modelo responde a partir de tus notas reales en vez de adivinar, la respuesta refleja lo que realmente escribiste — no una respuesta genérica e inventada.
- Sin reentrenamiento, sin fine-tuning. Agrega o quita documentos cuando quieras; el índice se actualiza y la siguiente pregunta busca en el conjunto actual de archivos.
Dónde encaja
- Una base de conocimiento personal — busca en años de notas o en un diario con solo hacer una pregunta en lenguaje natural.
- Documentación interna del equipo — apunta una configuración local a la documentación interna de una empresa para que las respuestas se mantengan fundamentadas en el material real del equipo.
- Casos de uso sensibles a la privacidad — los documentos propietarios o personales nunca tienen que salir de tu máquina ni enviarse a un proveedor público de I.A., ya que tanto la recuperación como la generación ocurren de forma local.
- Configuraciones multimodales — algunos modelos locales también pueden responder preguntas sobre imágenes subidas, no solo texto, si la interfaz de chat y el modelo lo admiten.
Errores comunes
- RAG no es fine-tuning. RAG consulta las cosas al momento de responder; no le enseña al modelo hechos nuevos de forma permanente. Si quieres un modelo que "simplemente sepa" algo sin un paso de búsqueda, eso es fine-tuning — un proceso distinto y más pesado.
- La calidad de la recuperación limita la calidad de la respuesta. Si el índice no encuentra el fragmento relevante de un documento, el modelo no lo verá y no podrá responder correctamente, aunque la información esté técnicamente en tus archivos.
- Indexar toma un momento. Los conjuntos grandes de documentos necesitan tiempo para procesarse antes de poder buscarse — eso es normal en la primera subida, no un bloqueo.
- Sigue siendo un modelo de lenguaje el que escribe. RAG fundamenta al modelo en pasajes reales, pero la respuesta final sigue siendo texto generado — vale la pena revisarla para cualquier cosa de la que dependas directamente.
Trucos avanzados
- Mantén los archivos fuente organizados (nombres de archivo claros, un tema por documento cuando sea posible) — la calidad de la recuperación depende de la calidad de los documentos más de lo que la gente espera.
- Usa RAG para todo lo que cambia con frecuencia (notas, documentos en evolución) y reserva el fine-tuning, si alguna vez lo necesitas, para conocimiento estable que quieras integrado en el modelo mismo.
- Para las empresas, una configuración de RAG totalmente on-premise significa que las preguntas y respuestas internas propietarias nunca tocan un proveedor público de I.A. — algo a considerar para cualquier cosa bajo un acuerdo de confidencialidad o un requisito de cumplimiento.
Recursos
¿Estás construyendo una función de IA? Yeda AI diseña, audita y lanza sistemas LLM en producción.