Cambiar tema

RAG + Agent: arquitectura de aplicaciones de IA de próxima generación

Easton editorial illustration: one agent core linked to a knowledge cylinder and answer card

Una empresa montó su RAG en tres meses y la primera semana el director la criticó: «¿Cómo no responde bien ni a una pregunta simple de reembolso de viajes?»

El RAG tradicional es como un estudiante que solo consulta el diccionario: pregunta X, busca X, sin entender la intención. Si preguntas «mi reembolso de viaje del mes pasado fue rechazado, ¿por qué?», puede devolver políticas generales sin consultar tu registro concreto.

Eso es lo que Agentic RAG intenta resolver.

Este artículo trata la arquitectura RAG + Agent que está remodelando las aplicaciones de IA empresariales: evolución, selección de frameworks, ruta de implementación y un caso real de atención al cliente.

De RAG tradicional a Agentic RAG

El RAG tradicional es simple: pregunta → recuperación vectorial → documentos → LLM genera respuesta. Tres pasos.

Ventajas: rápido, barato, fácil. Problemas también.

Recuperación imprecisa. Preguntas vagas devuelven documentos «parecidos pero irrelevantes». Preguntas «cómo configurar la base de datos» mezclan MySQL y PostgreSQL.

Sin razonamiento. Solo «recuperar-generar»; ante tareas multipaso falla. Si pides «compara pros y contras de A y B», puede recuperar solo A y inventar el resto.

"McKinsey: el 47% de usuarios de GenAI reportó consecuencias negativas; solo el 27% revisa todas las salidas"

Qué cambia Agentic RAG

La idea: la IA «piensa» cómo resolver el problema, no ejecuta mecánicamente recuperar-generar.

Ciclo central:

Plan → Retrieve → Act → Reflect → Answer

Plan: analiza y descompone. «Reembolso rechazado el mes pasado» → consultar registro, política, comparar motivo.

Retrieve: decide dónde y qué buscar: base de conocimiento, BD, APIs.

Act: ejecuta recuperación e invoca herramientas; puede replanificar.

Reflect: evalúa si el contexto basta y la respuesta es razonable; si no, vuelve a Plan.

Answer: respuesta final con citas.

RAG tradicional es diccionario; Agentic RAG es un asistente de investigación que analiza, busca, verifica y responde.

144.600 millones USD
Gasto en IA en Europa previsto (2028)
Source: Predicción IDC

Detrás de la cifra, las empresas pasan de «que funcione» a «que funcione bien». Agentic RAG es un paso clave.

10 patrones de arquitectura RAG

Resumen de lo esencial; la tabla comparativa al final da la visión global.

Naive RAG: nivel inicial

Pregunta → vector → respuesta. Sirve para validar ideas; en producción suele quedarse corto.

Problemas: baja precisión, desperdicio de contexto, alucinaciones. Solo POC o herramientas internas.

Hybrid RAG: estándar empresarial

Combina búsqueda léxica (keywords) y semántica (vectores).

20-40%
Mejora de precisión Top-k con fusion retrieval
Source: Datos de prueba Aplyca

Léxica para coincidencia exacta; semántica para intención. BM25 + vector DB (Pinecone, Weaviate, Milvus) y fusión RRF.

Graph RAG: razonamiento multi-salto

Para «por qué» y «cómo se relaciona». Grafo de entidades; p. ej. «qué productos usan piezas de este proveedor».

Costo 3-5x vs RAG básico: construir y mantener el grafo no es barato.

Agentic RAG: pensamiento activo

Flexibilidad a doble filo: problemas complejos sí; latencia y costo altos. Enrutamiento: simples por RAG clásico, complejos por Agent.

Self-RAG: autocorrección

El modelo evalúa relevancia del contexto y fidelidad de la respuesta; si falla, re-recupera o corrige. Más costo de inferencia; la evaluación también puede fallar.

Agentic Graph RAG: techo actual

Agente + grafo: multi-salto y planificación activa. Costo máximo; solo escenarios críticos.

Tabla comparativa

PatrónComplejidadEscenarioCosto relativoLatencia
Naive RAGBajaValidación rápida1x<1s
Hybrid RAGMediaProducción estándar1.5x1-2s
Graph RAGAltaMulti-salto, conocimiento denso3-5x2-4s
Agentic RAGAltaDecisiones complejas3-8x3-10s
Self-RAGMedia-altaAlta precisión2-3x2-4s
Agentic Graph RAGMuy altaNegocio crítico5-10x5-15s

Empieza con Hybrid RAG y evoluciona. No persigas el patrón más avanzado desde el día uno.

Frameworks: LangChain vs LlamaIndex vs CrewAI vs AutoGen

La elección importa: un proyecto nuestro tuvo que rehacerse a mitad por ecosistema insuficiente.

LangChain / LangGraph: ecosistema más amplio

Si dudas, LangChain suele funcionar. Docs, comunidad, 25K+ stars en LangGraph.

LangGraph: máquina de estados para Agent con persistencia, reanudación y depuración temporal.

Escenario: flujos productivos, estado persistente, orquestación compleja.

# Ejemplo simplificado LangGraph: agente de planificación de consultas
from langgraph.graph import StateGraph

def plan_query(state):
    """Analiza la pregunta y planifica pasos de recuperación"""
    query = state["query"]
    sub_queries = decompose(query)
    return {"sub_queries": sub_queries}

def retrieve(state):
    """Ejecuta recuperación"""
    results = []
    for q in state["sub_queries"]:
        docs = retriever.invoke(q)
        results.extend(docs)
    return {"context": results}

workflow = StateGraph(AgentState)
workflow.add_node("plan", plan_query)
workflow.add_node("retrieve", retrieve)
workflow.add_edge("plan", "retrieve")

LlamaIndex: datos no estructurados

Muchos documentos, BD, APIs: motores de consulta vectorial, keyword, híbrido, grafo; conectores maduros.

CrewAI: prototipos rápidos

Equipos por roles: investigador, autor, editor. Comunidad 100K+, 20K+ stars.

AutoGen: multiagente de Microsoft

Colaboración conversacional; human-in-the-loop. 50K+ stars; curva de aprendizaje y depuración exigentes.

Árbol de decisión

¿Tipo de proyecto?
├── Flujo productivo persistente → LangGraph
├── RAG intensivo en datos → LlamaIndex
├── Prototipo / proceso de negocio → CrewAI
├── Investigación / multiagente conversacional → AutoGen
└── Incierto / máxima flexibilidad → LangChain + LangGraph

No hay respuesta única: mira stack del equipo y ritmo de actualización del framework.

Hoja de ruta empresarial (~90 días)

Fase 1: Día 0-15, problema y KPI

Antes de frameworks: ¿qué problema resolvemos?

  1. ¿Usuarios internos o clientes?
  2. ¿Escenario: Q&A, búsqueda o razonamiento complejo?
  3. ¿Métricas: precisión, latencia, satisfacción?

Recoge 50-100 preguntas reales para test y evaluación.

Fase 2: Día 16-45, datos y recuperación

Limpieza: duplicados, obsoletos, sensibles.

Chunking: 500-1000 palabras en docs técnicos; leyes por artículo.

Embeddings: text-embedding-3, Cohere, BGE; prueba en subconjunto.

Capa de recuperación: Hybrid RAG (BM25 + vectores).

Fase 3: Día 46-75, orquestación Agent

Enrutamiento: FAQ por RAG clásico; complejas por Agent.

Herramientas: MCP hacia sistemas internos (BD, APIs, docs).

Orquestación: LangGraph u similar; empieza con ReAct simple.

Fase 4: Día 76-90, evaluación y endurecimiento

RAGAS:

  • Faithfulness >= 0.8
  • Answer Relevance
  • Context Relevance

Técnicas: Recall@K >= 0.85, P95 <= 2.5s, costo por petición.

Trampas comunes

  1. Bypass de control de acceso vía herramientas del Agent
  2. Contexto caducado en conversaciones largas
  3. Costo descontrolado por múltiples rondas de recuperación

Caso real: asistente de atención al cliente

Escenario: producto, pedidos, posventa, políticas en sistemas distintos.

Problema: RAG clásico solo consulta la base de conocimiento, no el estado del pedido del usuario.

Arquitectura en tres capas

Capa 1: Routing Agent

  • «Cómo usar el producto» → base de conocimiento
  • «¿Dónde está mi pedido?» → sistema de pedidos
  • «Política de reembolso» → documentos de política

Capa 2: Query Planning Agent

«¿Puedo devolver el móvil que compré el mes pasado?» → pedido + política + plazos.

Capa 3: ReAct Agent

Ejecuta recuperación e invocaciones con iteración.

Integración de herramientas (MCP)

tools:
  - name: knowledge_search
    type: vector_retrieval
    source: product_docs

  - name: order_query
    type: api_call
    endpoint: /api/orders/{user_id}

  - name: policy_search
    type: hybrid_retrieval
    sources: [policy_docs, faq]

Resultados

MétricaRAG tradicionalAgentic RAG
Tasa de resolución45%78%
Tiempo medio1.2s3.5s
Satisfacción3.2/54.1/5
Intervención humana55%22%

+33 puntos en resolución; intervención humana a la mitad. Latencia mayor: trade-off inevitable.

Conclusión

RAG + Agent se consolida como arquitectura estándar: de recuperación pasiva a razonamiento activo.

Recomendaciones:

  1. Empieza simple — Hybrid RAG antes que Agentic Graph RAG
  2. Controla costos — enrutamiento y caché obligatorios
  3. Evalúa con métricas — RAGAS + test propio
  4. Protocolos abiertos — MCP para herramientas; A2A para colaboración entre frameworks

Si estás montando RAG, espero que esto sirva de referencia.

FAQ

¿Diferencia central entre Agentic RAG y RAG tradicional?
RAG tradicional: pregunta → recuperación → respuesta. Agentic RAG razona: Plan → Retrieve → Act → Reflect → Answer; descompone problemas, recupera en varias rondas y se autocorrige.
¿Qué arquitectura RAG elegir en empresa?
Empieza con Hybrid RAG: costo controlado y buenos resultados. Luego Graph RAG (multi-salto), Agentic RAG (decisiones complejas), Agentic Graph RAG (negocio core).
¿LangChain, LlamaIndex o CrewAI?
Según proyecto:
- Flujo persistente producción → LangGraph - RAG intensivo en datos → LlamaIndex - Prototipo rápido → CrewAI - Investigación multi-agent → AutoGen
¿Cómo controlar costo y latencia en Agentic RAG?
Enrutamiento (simple=RAG clásico, complejo=Agent), caché, límite de iteraciones, alertas de costo API.
¿Cuánto tarda un proyecto RAG + Agent?
4 fases ~90 días: D0-15 KPIs; D16-45 datos y recuperación; D46-75 Agent y herramientas; D76-90 evaluación. Ajustable según equipo.
¿Cómo evaluar un sistema RAG?
RAGAS: Faithfulness >= 0,8, Answer Relevance, Context Relevance. Técnicos: Recall@K >= 0,85, latencia P95 <= 2,5 s.

6 min de lectura · Publicado el: 22 mar 2026 · Actualizado el: 21 ago 2026

Comentarios

Inicia sesión con GitHub para dejar un comentario

Easton BlogEaston Blog