RAG + Agent: arquitectura de aplicaciones de IA de próxima generación

Una empresa montó su RAG en tres meses y la primera semana el director la criticó: «¿Cómo no responde bien ni a una pregunta simple de reembolso de viajes?»
El RAG tradicional es como un estudiante que solo consulta el diccionario: pregunta X, busca X, sin entender la intención. Si preguntas «mi reembolso de viaje del mes pasado fue rechazado, ¿por qué?», puede devolver políticas generales sin consultar tu registro concreto.
Eso es lo que Agentic RAG intenta resolver.
Este artículo trata la arquitectura RAG + Agent que está remodelando las aplicaciones de IA empresariales: evolución, selección de frameworks, ruta de implementación y un caso real de atención al cliente.
De RAG tradicional a Agentic RAG
El RAG tradicional es simple: pregunta → recuperación vectorial → documentos → LLM genera respuesta. Tres pasos.
Ventajas: rápido, barato, fácil. Problemas también.
Recuperación imprecisa. Preguntas vagas devuelven documentos «parecidos pero irrelevantes». Preguntas «cómo configurar la base de datos» mezclan MySQL y PostgreSQL.
Sin razonamiento. Solo «recuperar-generar»; ante tareas multipaso falla. Si pides «compara pros y contras de A y B», puede recuperar solo A y inventar el resto.
"McKinsey: el 47% de usuarios de GenAI reportó consecuencias negativas; solo el 27% revisa todas las salidas"
Qué cambia Agentic RAG
La idea: la IA «piensa» cómo resolver el problema, no ejecuta mecánicamente recuperar-generar.
Ciclo central:
Plan → Retrieve → Act → Reflect → Answer
Plan: analiza y descompone. «Reembolso rechazado el mes pasado» → consultar registro, política, comparar motivo.
Retrieve: decide dónde y qué buscar: base de conocimiento, BD, APIs.
Act: ejecuta recuperación e invoca herramientas; puede replanificar.
Reflect: evalúa si el contexto basta y la respuesta es razonable; si no, vuelve a Plan.
Answer: respuesta final con citas.
RAG tradicional es diccionario; Agentic RAG es un asistente de investigación que analiza, busca, verifica y responde.
Detrás de la cifra, las empresas pasan de «que funcione» a «que funcione bien». Agentic RAG es un paso clave.
10 patrones de arquitectura RAG
Resumen de lo esencial; la tabla comparativa al final da la visión global.
Naive RAG: nivel inicial
Pregunta → vector → respuesta. Sirve para validar ideas; en producción suele quedarse corto.
Problemas: baja precisión, desperdicio de contexto, alucinaciones. Solo POC o herramientas internas.
Hybrid RAG: estándar empresarial
Combina búsqueda léxica (keywords) y semántica (vectores).
Léxica para coincidencia exacta; semántica para intención. BM25 + vector DB (Pinecone, Weaviate, Milvus) y fusión RRF.
Graph RAG: razonamiento multi-salto
Para «por qué» y «cómo se relaciona». Grafo de entidades; p. ej. «qué productos usan piezas de este proveedor».
Costo 3-5x vs RAG básico: construir y mantener el grafo no es barato.
Agentic RAG: pensamiento activo
Flexibilidad a doble filo: problemas complejos sí; latencia y costo altos. Enrutamiento: simples por RAG clásico, complejos por Agent.
Self-RAG: autocorrección
El modelo evalúa relevancia del contexto y fidelidad de la respuesta; si falla, re-recupera o corrige. Más costo de inferencia; la evaluación también puede fallar.
Agentic Graph RAG: techo actual
Agente + grafo: multi-salto y planificación activa. Costo máximo; solo escenarios críticos.
Tabla comparativa
| Patrón | Complejidad | Escenario | Costo relativo | Latencia |
|---|---|---|---|---|
| Naive RAG | Baja | Validación rápida | 1x | <1s |
| Hybrid RAG | Media | Producción estándar | 1.5x | 1-2s |
| Graph RAG | Alta | Multi-salto, conocimiento denso | 3-5x | 2-4s |
| Agentic RAG | Alta | Decisiones complejas | 3-8x | 3-10s |
| Self-RAG | Media-alta | Alta precisión | 2-3x | 2-4s |
| Agentic Graph RAG | Muy alta | Negocio crítico | 5-10x | 5-15s |
Empieza con Hybrid RAG y evoluciona. No persigas el patrón más avanzado desde el día uno.
Frameworks: LangChain vs LlamaIndex vs CrewAI vs AutoGen
La elección importa: un proyecto nuestro tuvo que rehacerse a mitad por ecosistema insuficiente.
LangChain / LangGraph: ecosistema más amplio
Si dudas, LangChain suele funcionar. Docs, comunidad, 25K+ stars en LangGraph.
LangGraph: máquina de estados para Agent con persistencia, reanudación y depuración temporal.
Escenario: flujos productivos, estado persistente, orquestación compleja.
# Ejemplo simplificado LangGraph: agente de planificación de consultas
from langgraph.graph import StateGraph
def plan_query(state):
"""Analiza la pregunta y planifica pasos de recuperación"""
query = state["query"]
sub_queries = decompose(query)
return {"sub_queries": sub_queries}
def retrieve(state):
"""Ejecuta recuperación"""
results = []
for q in state["sub_queries"]:
docs = retriever.invoke(q)
results.extend(docs)
return {"context": results}
workflow = StateGraph(AgentState)
workflow.add_node("plan", plan_query)
workflow.add_node("retrieve", retrieve)
workflow.add_edge("plan", "retrieve")
LlamaIndex: datos no estructurados
Muchos documentos, BD, APIs: motores de consulta vectorial, keyword, híbrido, grafo; conectores maduros.
CrewAI: prototipos rápidos
Equipos por roles: investigador, autor, editor. Comunidad 100K+, 20K+ stars.
AutoGen: multiagente de Microsoft
Colaboración conversacional; human-in-the-loop. 50K+ stars; curva de aprendizaje y depuración exigentes.
Árbol de decisión
¿Tipo de proyecto?
├── Flujo productivo persistente → LangGraph
├── RAG intensivo en datos → LlamaIndex
├── Prototipo / proceso de negocio → CrewAI
├── Investigación / multiagente conversacional → AutoGen
└── Incierto / máxima flexibilidad → LangChain + LangGraph
No hay respuesta única: mira stack del equipo y ritmo de actualización del framework.
Hoja de ruta empresarial (~90 días)
Fase 1: Día 0-15, problema y KPI
Antes de frameworks: ¿qué problema resolvemos?
- ¿Usuarios internos o clientes?
- ¿Escenario: Q&A, búsqueda o razonamiento complejo?
- ¿Métricas: precisión, latencia, satisfacción?
Recoge 50-100 preguntas reales para test y evaluación.
Fase 2: Día 16-45, datos y recuperación
Limpieza: duplicados, obsoletos, sensibles.
Chunking: 500-1000 palabras en docs técnicos; leyes por artículo.
Embeddings: text-embedding-3, Cohere, BGE; prueba en subconjunto.
Capa de recuperación: Hybrid RAG (BM25 + vectores).
Fase 3: Día 46-75, orquestación Agent
Enrutamiento: FAQ por RAG clásico; complejas por Agent.
Herramientas: MCP hacia sistemas internos (BD, APIs, docs).
Orquestación: LangGraph u similar; empieza con ReAct simple.
Fase 4: Día 76-90, evaluación y endurecimiento
RAGAS:
- Faithfulness >= 0.8
- Answer Relevance
- Context Relevance
Técnicas: Recall@K >= 0.85, P95 <= 2.5s, costo por petición.
Trampas comunes
- Bypass de control de acceso vía herramientas del Agent
- Contexto caducado en conversaciones largas
- Costo descontrolado por múltiples rondas de recuperación
Caso real: asistente de atención al cliente
Escenario: producto, pedidos, posventa, políticas en sistemas distintos.
Problema: RAG clásico solo consulta la base de conocimiento, no el estado del pedido del usuario.
Arquitectura en tres capas
Capa 1: Routing Agent
- «Cómo usar el producto» → base de conocimiento
- «¿Dónde está mi pedido?» → sistema de pedidos
- «Política de reembolso» → documentos de política
Capa 2: Query Planning Agent
«¿Puedo devolver el móvil que compré el mes pasado?» → pedido + política + plazos.
Capa 3: ReAct Agent
Ejecuta recuperación e invocaciones con iteración.
Integración de herramientas (MCP)
tools:
- name: knowledge_search
type: vector_retrieval
source: product_docs
- name: order_query
type: api_call
endpoint: /api/orders/{user_id}
- name: policy_search
type: hybrid_retrieval
sources: [policy_docs, faq]
Resultados
| Métrica | RAG tradicional | Agentic RAG |
|---|---|---|
| Tasa de resolución | 45% | 78% |
| Tiempo medio | 1.2s | 3.5s |
| Satisfacción | 3.2/5 | 4.1/5 |
| Intervención humana | 55% | 22% |
+33 puntos en resolución; intervención humana a la mitad. Latencia mayor: trade-off inevitable.
Conclusión
RAG + Agent se consolida como arquitectura estándar: de recuperación pasiva a razonamiento activo.
Recomendaciones:
- Empieza simple — Hybrid RAG antes que Agentic Graph RAG
- Controla costos — enrutamiento y caché obligatorios
- Evalúa con métricas — RAGAS + test propio
- Protocolos abiertos — MCP para herramientas; A2A para colaboración entre frameworks
Si estás montando RAG, espero que esto sirva de referencia.
FAQ
¿Diferencia central entre Agentic RAG y RAG tradicional?
¿Qué arquitectura RAG elegir en empresa?
¿LangChain, LlamaIndex o CrewAI?
- Flujo persistente producción → LangGraph - RAG intensivo en datos → LlamaIndex - Prototipo rápido → CrewAI - Investigación multi-agent → AutoGen
¿Cómo controlar costo y latencia en Agentic RAG?
¿Cuánto tarda un proyecto RAG + Agent?
¿Cómo evaluar un sistema RAG?
6 min de lectura · Publicado el: 22 mar 2026 · Actualizado el: 21 ago 2026
Guía de ingeniería RAG
Estás leyendo el primer artículo de esta serie. Continúa con el siguiente o abre el hub para ver toda la ruta.



Comentarios
Inicia sesión con GitHub para dejar un comentario