Definición:
RAG, siglas de Retrieval-Augmented Generation o generación aumentada por recuperación, es una arquitectura de inteligencia artificial que recupera información de fuentes externas y la incorpora al contexto de un modelo generativo antes de producir una respuesta. Así combina un sistema de recuperación con un modelo de lenguaje.
La información recuperada puede proceder de documentos, bases de conocimiento, catálogos, sitios web o sistemas internos. RAG permite consultar contenido que no forma parte de los parámetros del modelo, pero no garantiza por sí solo respuestas correctas, actuales ni respaldadas. El resultado depende de la calidad completa del proceso.
Índice de contenidos
Origen y alcance de RAG
El nombre se consolidó con el trabajo publicado en 2020 por Patrick Lewis y otros investigadores, que combinó memoria paramétrica y no paramétrica para tareas intensivas en conocimiento. Desde entonces, RAG se ha extendido como un patrón de arquitectura aplicable a diferentes modelos, recuperadores y fuentes.
RAG no es un modelo de lenguaje, una base de datos ni un producto concreto. Tampoco obliga a buscar en internet. Un sistema puede recuperar información pública o privada, estructurada o no estructurada, siempre que pueda seleccionarla y convertirla en contexto utilizable para la generación.
La arquitectura resulta útil cuando el conocimiento cambia con frecuencia, pertenece a una organización o necesita aportar procedencia. Actualizar las fuentes puede ser más rápido que volver a entrenar un modelo, aunque la preparación, indexación y supervisión de esas fuentes siguen requiriendo trabajo operativo.
Cómo funciona RAG
Una implementación puede variar, pero el recorrido habitual separa la preparación del conocimiento y la respuesta a cada consulta. El proceso básico comprende estas etapas:
- Preparar fuentes: Seleccionar documentos, limpiar contenido, conservar metadatos y definir permisos de acceso.
- Dividir contenido: Crear fragmentos con tamaño y solapamiento adecuados para la información y las preguntas previstas.
- Representar e indexar: Generar un embedding u otra representación y almacenarla en un índice consultable.
- Recuperar: Buscar fragmentos candidatos mediante similitud, palabras clave, filtros, relaciones o una combinación de métodos.
- Ampliar contexto: Incorporar la consulta, las instrucciones y los fragmentos seleccionados dentro de la ventana de contexto.
- Generar respuesta: Pedir al modelo que responda con el contexto disponible y, cuando proceda, muestre referencias o reconozca que falta evidencia.
Después de la recuperación puede intervenir un reranker que reordene candidatos o reglas que eliminen duplicados y contenido no autorizado. La búsqueda semántica es frecuente, pero RAG no se limita a ella: una consulta híbrida puede combinar señales distintas para mejorar la selección.
Componentes del sistema
Los embeddings representan contenido en un espacio numérico para comparar proximidad semántica. Una base de datos vectorial puede almacenar esas representaciones y buscar vecinos, pero ninguna de las dos piezas constituye RAG por separado. También pueden utilizarse índices léxicos, bases relacionales, grafos o servicios de búsqueda.
El recuperador decide qué información candidata llega al modelo. Su rendimiento depende del contenido indexado, la segmentación, la consulta, los filtros y el criterio de ordenación. Si recupera fragmentos irrelevantes o deja fuera una fuente esencial, el generador parte de un contexto deficiente.
El modelo generativo interpreta la consulta y redacta la salida. Puede seguir instrucciones, sintetizar varios fragmentos y dar formato a la respuesta, pero también puede ignorar evidencia, mezclar fuentes o añadir afirmaciones no respaldadas. RAG reduce ciertas oportunidades de invención, no elimina la capacidad de error.
El fine-tuning modifica el comportamiento o los parámetros de un modelo mediante entrenamiento adicional. RAG aporta información durante la inferencia. Ambos enfoques resuelven problemas diferentes y pueden combinarse cuando se necesita adaptar el comportamiento y consultar conocimiento externo.
Aplicaciones de RAG
RAG se utiliza cuando una aplicación debe responder a partir de un conjunto identificable de información. Entre los casos habituales se encuentran:
- Atención al cliente: Consultar manuales, políticas, incidencias y fichas de producto para orientar una respuesta.
- Conocimiento interno: Buscar en procedimientos, documentación técnica, informes y repositorios con control de acceso.
- Ámbitos especializados: Localizar material jurídico, científico, educativo o sanitario antes de generar una síntesis que requiere revisión experta.
- Búsqueda asistida: Responder preguntas sobre catálogos o colecciones y mantener enlaces hacia los documentos recuperados.
- Creación documental: Preparar borradores, resúmenes o comparaciones basados en fuentes concretas, sin sustituir la comprobación editorial.
La misma arquitectura puede intervenir en asistentes, buscadores, herramientas de soporte o flujos de agentes. El valor no procede de presentar una respuesta directa, sino de conectar la tarea con información pertinente y conservar controles sobre su uso.
Evaluación del sistema
La evaluación debe separar la recuperación de la generación. Una respuesta fluida puede apoyarse en documentos inadecuados, mientras que una recuperación correcta puede terminar en una síntesis incompleta. Conviene utilizar un conjunto de preguntas representativas y revisar estas dimensiones:
- Cobertura: Si el sistema recupera los fragmentos necesarios para responder.
- Precisión: Si los candidatos seleccionados son pertinentes y no introducen ruido innecesario.
- Fundamentación: Si cada afirmación relevante se apoya en el contexto proporcionado.
- Respuesta: Si la salida resuelve la consulta, reconoce límites y utiliza correctamente las referencias.
- Operación: Latencia, coste, disponibilidad, actualización y cumplimiento de permisos.
Las métricas automáticas ayudan a comparar configuraciones, pero necesitan muestras revisadas por personas y pruebas de los casos difíciles. La supervisión debe detectar cambios en las fuentes, nuevas consultas, fallos de acceso y degradación. Medir solo satisfacción o apariencia puede ocultar errores factuales.
Limitaciones de RAG
RAG no corrige una fuente falsa, desactualizada o contradictoria. Tampoco puede utilizar un documento que el proceso no ha incorporado, no recupera o corta de forma que pierde el sentido. La gobernanza del contenido y los ciclos de actualización condicionan la fiabilidad final.
Mostrar una cita no demuestra que la afirmación esté respaldada por ella. El sistema debe vincular respuesta y fragmento, evitar referencias inventadas y permitir abrir la fuente original. En contextos sensibles, la salida necesita verificación adicional y no debe presentarse como decisión profesional automática.
Las fuentes pueden contener instrucciones maliciosas, datos personales o material que un usuario no debería consultar. El diseño debe aplicar permisos antes de recuperar, registrar accesos, proteger información sensible y tratar el contenido recuperado como datos no confiables, no como órdenes para el modelo.
También existen costes de indexación, almacenamiento, recuperación y generación, además de latencia y mantenimiento. La decisión de usar RAG debe partir de la tarea, la evidencia disponible y el nivel de riesgo. Para consultas estables o procesos deterministas, una búsqueda convencional o una respuesta estructurada puede ser una solución más simple.
