Los grandes modelos de lenguaje tienen un problema estructural que ninguna mejora en parámetros resuelve por sí sola: no saben lo que no vieron durante su entrenamiento, y ese conocimiento quedó congelado en el tiempo. Pregúntale a un LLM por el contenido de un contrato firmado ayer, el estado de una incidencia abierta esta mañana o la política interna de tu empresa. No lo sabe. No puede saberlo.

Esa brecha es exactamente la que Retrieval-Augmented Generation —RAG— vino a cerrar. No ampliando el modelo ni reentrenándolo, sino dándole acceso dinámico a conocimiento externo justo en el momento en que responde. Desde que Patrick Lewis y su equipo en Facebook AI Research publicaron el paper fundacional en 2020, RAG pasó de curiosidad académica a columna vertebral de la mayoría de aplicaciones de IA en producción.
Pero RAG no es una arquitectura única. Es una familia. Y entender sus variantes es hoy una habilidad fundamental para cualquier persona que construya sistemas de IA.
El mecanismo básico: indexar, recuperar, generar
En su forma más esencial, RAG tiene tres etapas. Primero, indexación: los documentos fuente se dividen en fragmentos, se convierten en vectores numéricos mediante modelos de embeddings y se almacenan en bases de datos vectoriales como Pinecone, Chroma o pgvector. Segundo, recuperación: cuando llega una consulta, se convierte también en vector y se buscan los fragmentos más cercanos por similitud coseno. Tercero, generación aumentada: esos fragmentos recuperados se insertan en el prompt junto con la pregunta, y el LLM responde fundamentándose en ese contexto externo.
El resultado son respuestas más precisas, actualizadas y —si el sistema está bien construido— trazables hasta la fuente. Sobre esa base, han emergido siete variantes con perfiles de uso distintos.
Las siete variantes: de lo simple a lo complejo
1. Naive RAG — El punto de partida
La implementación más directa del paper original. Se indexan documentos, se recuperan los más similares y se pasan al LLM sin filtros adicionales. Su virtud es la simplicidad: se puede montar en horas. Su límite es que la búsqueda vectorial devuelve los fragmentos más cercanos en el espacio de embeddings, no necesariamente los más útiles. Con corpus grandes, los falsos positivos proliferan. Útil para prototipos y Q&A sobre corpus pequeños y bien estructurados.
2. Retrieve + Rerank — El salto a producción
Añade una etapa crucial: un modelo cross-encoder que evalúa la relevancia real de cada fragmento recuperado antes de pasarlo al LLM. El flujo recupera primero un conjunto amplio de candidatos (20–50 fragmentos) y luego los reordena con un modelo que ve consulta y documento juntos, capturando interacciones semánticas finas que un embedding simple no detecta. Modelos como Cohere Rerank o BGE Reranker son opciones habituales. Para la mayoría de proyectos en producción, este es el punto de partida sólido.
3. Multimodal RAG — Cuando el texto no es suficiente
Una cantidad enorme de conocimiento crítico vive en formatos visuales: diagramas técnicos, gráficos financieros, planos, tablas complejas. El Multimodal RAG cierra esa brecha mediante tres estrategias posibles: conversión a texto usando modelos de visión (GPT-4V, Gemini) durante la indexación; embeddings multimodales como CLIP que operan en el mismo espacio semántico para texto e imágenes; o integración directa de contenido visual en el contexto cuando el modelo de generación es multimodal. Especialmente relevante en manufactura, medicina e ingeniería.
4. Graph RAG — Cuando importan las relaciones
La búsqueda vectorial presupone que el conocimiento relevante es el semánticamente similar a la consulta. Pero hay preguntas que requieren navegar relaciones explícitas entre conceptos: «¿qué regulaciones afectan a los productos del proveedor X?» no es una pregunta de similitud, sino de recorrido: proveedor → productos → categoría → normativa. Graph RAG construye un grafo de conocimiento donde las entidades son nodos y las relaciones son aristas tipadas. El paper de Microsoft Research de 2024 demostró que supera consistentemente a los RAG vectoriales en preguntas que requieren síntesis multi-documento o razonamiento relacional.
5. Hybrid RAG — Lo mejor de los dos mundos
Combina búsqueda vectorial densa (semántica), búsqueda léxica dispersa con BM25 (que captura términos técnicos o nombres propios que los embeddings a veces difuminan) y recorrido de grafo de conocimiento. Los resultados de los tres canales se fusionan mediante Reciprocal Rank Fusion (RRF) antes del reranking final. El coste es mayor complejidad operativa, pero para dominios de alto valor —legal, financiero, biomédico— la mejora en calidad se justifica con claridad.
6. Agentic RAG — El sistema que decide cómo recuperar
Introduce un agente de decisión —generalmente un LLM con herramientas— que analiza cada consulta y decide dinámicamente la mejor estrategia: búsqueda vectorial directa, múltiples búsquedas en paralelo, activación del grafo, búsqueda web en tiempo real. Implementa bucles de razonamiento como ReAct (Reasoning + Acting): razona, actúa, observa el resultado y decide el siguiente paso. La adaptabilidad es su ventaja principal; la latencia y el coste de tokens, su principal restricción.
7. Multi-Agent RAG — Orquestación a escala
Múltiples agentes especializados coordinados por un orquestador: un agente para bases vectoriales, otro para APIs externas, otro para grafos, otro para verificación de hechos, otro para ejecución de código. El orquestador descompone la tarea, asigna subtareas, resuelve contradicciones y sintetiza la respuesta final. Frameworks como LangGraph, AutoGen o CrewAI facilitan la implementación. Transforma RAG en orquestación de flujos de trabajo cognitivos completos. Complejidad muy alta, pero es la arquitectura que mejor escala en sistemas enterprise con fuentes heterogéneas.
¿Cuál elegir?
La clave no es elegir la arquitectura más sofisticada posible, sino la mínima necesaria para resolver el problema con calidad suficiente. Empezar con Naive RAG es razonable al explorar. Llegar a producción robusta requiere al menos Retrieve + Rerank como base, y añadir capas —multimodalidad, grafos, agencia— de forma incremental según los requisitos reales del dominio. El RAG bien construido responde con precisión, cita sus fuentes, escala con el volumen y falla de forma predecible cuando no sabe algo. Ese es el estándar al que aspirar.