Ingeniería de agentes de IA en 2026: cómo elegir entre LangGraph y OpenAI Agents SDK

"Documentación de OpenAI Agents SDK"
Una demo de agente para investigación de clientes ya puede buscar documentación, resumir resultados y enviar un mensaje a Lark. El problema aparece cuando el equipo intenta llevarla a producción: faltan colas, aprobaciones, recuperación ante fallos, logs, límites de costo y pruebas de regresión. Cuando producto pregunta si operaciones puede usarlo la semana siguiente, el desarrollador entiende que elegir entre LangGraph y OpenAI Agents SDK no va de qué demo corre más rápido. Va de siete dimensiones de ingeniería: persistencia de estado, aprobación humana, observabilidad, presupuesto de costos, modelo de permisos, eval dataset y recuperación ante fallos.
OpenAI Agents SDK: la opción ligera primero
OpenAI Agents SDK es una herramienta ligera, code-first, para construir agentes cerca del ecosistema de modelos y llamadas a herramientas de OpenAI.
Sus primitivas principales son:
| Primitiva | Qué hace | Límite |
|---|---|---|
| Agents | Unidad compuesta por instructions, model, tools, MCP servers, handoffs y guardrails | No es un grafo de estado explícito; el estado de negocio se diseña aparte |
| Handoffs | Mecanismo multiagente para que un agente entregue una tarea a otro | No equivale a control de workflow de larga duración |
| Guardrails | Guardrails input/output que ejecutan comprobaciones en paralelo y lanzan excepción cuando se activa un tripwire | No equivalen a modelo completo de permisos, auditoría o aprobación de cumplimiento |
| Tracing | Traces/spans integrados, con processor personalizado y control de datos sensibles | No equivale a sistema completo de monitoreo, alertas, presupuesto o rollback |
| Tools | Soporta OpenAI Hosted tools, herramientas de función personalizadas y MCP servers | Los tipos concretos de herramientas y el soporte MCP deben revisarse en la documentación actual |
| Sessions / HITL | La documentación oficial incluye entradas para sessions, human-in-the-loop y sandbox agents | No equivale a graph checkpointing, time travel o replay al estilo LangGraph |
Si necesitas construir rápido un agente ligero en código, depender sobre todo de modelos y herramientas de OpenAI, tener handoffs multiagente, guardrails alrededor de entradas y salidas, tracing del SDK y menor complejidad de framework, OpenAI Agents SDK es la opción más ligera. Ejemplos: atención al cliente, búsqueda documental + resumen, o varios agentes que procesan tareas en secuencia.
El costo es la responsabilidad. Guardrails puede validar entradas y salidas, pero los flujos de aprobación complejos, el aislamiento de permisos y los logs de auditoría siguen en la capa de negocio. Tracing puede conectarse a OpenTelemetry o a un processor propio, pero el equipo todavía necesita logs, métricas, alertas, presupuesto de costos y pruebas de regresión. Sessions y HITL cubren parte de la conversación y de la intervención humana. Si necesitas un grafo de estado explícito, checkpoints, resume/replay, time travel o control de workflows largos, todavía debes evaluar LangGraph, Temporal o una capa propia de estado de negocio.
No encaja bien en escenarios con ramas de estado complejas, pausas y reanudación tras aprobación, procesos con SLA fuerte que exigen retry, rollback y trazabilidad, o workflows que requieren replay de estado y orquestación de larga duración.
Nota sobre hechos volátiles: la API de OpenAI Agents SDK, los modelos por defecto, Hosted tools, soporte MCP, sessions, sandbox agents, comportamiento de tracing y precios pueden cambiar. Revisa la documentación de OpenAI Agents SDK antes de integrar.
LangGraph: fuerte en estado explícito y persistencia
LangGraph es un low-level orchestration framework para stateful agents. Su foco está en durable execution, HITL, memory y time travel.
Capacidades principales:
| Capacidad | Qué significa | Uso típico |
|---|---|---|
| Durable execution | Persiste threads y checkpoint/state snapshots mediante un checkpointer | Reanudar o reproducir desde un checkpoint después de un fallo |
| Human-in-the-loop | Usa interrupt para pausar y Command resume para continuar; permite approve/reject/edit/review de tool calls | Flujos de aprobación complejos y revisión humana de acciones sensibles |
| Memory | Ofrece comprehensive memory para contexto de corto y largo plazo | Diseño de sistemas de memoria de agentes |
| Time travel | Reproduce o hace fork desde checkpoints históricos | Reproducir ejecuciones fallidas y comparar ramas |
Mecánica de persistencia
La persistencia de LangGraph no es solo historial de chat. Se organiza alrededor de threads y checkpoints:
Thread: el hilo de ejecución de una conversación o workflow. Checkpoint: una instantánea completa del estado en un momento concreto, incluidos graph state, pending tasks y pending writes. Resume/Replay: continuar desde un checkpoint o reproducir una ruta histórica de ejecución.
Este modelo encaja cuando hacen falta pausa/reanudación, reintentos tras fallo y replay de estado. Por ejemplo: flujos de aprobación en soporte, workflows de negocio multi paso o agentes de investigación de larga duración.
Human-in-the-loop(HITL)
El HITL de LangGraph está más cerca de pausar y reanudar un workflow con estado:
Interrupt pausa la ejecución en un nodo y espera entrada humana. Command resume continúa después de que una persona apruebe, rechace o edite. Tool-call review puede pausar antes de una llamada a herramienta para pedir aprobación.
Comparado con los guardrails de OpenAI Agents SDK, los guardrails son más bien comprobaciones antes o después de una ejecución. El HITL de LangGraph pausa y reanuda en medio del workflow. Si tu flujo de aprobación necesita varios turnos, estado guardado, replay y ramas, LangGraph suele encajar mejor.
Si necesitas ramas de estado complejas, recuperación, pausas de aprobación y replay de estado, LangGraph está más cerca de una orquestación de producción. Ejemplos: flujos de aprobación en soporte, workflows de negocio multi paso y agentes de investigación de larga duración.
El costo es la complejidad. Tienes que diseñar y mantener un grafo de estado. También debes elegir un backend de persistencia, y el soporte puede cambiar; por eso conviene revisar la documentación actual antes de integrar.
No encaja tan bien en tareas cortas, prototipos con poco estado o proyectos que dependen sobre todo del ecosistema de herramientas de OpenAI y no necesitan persistencia ni aprobaciones complejas.
Nota sobre hechos volátiles: LangGraph v1, Platform/Studio/Deployment y el soporte de backends de persistencia pueden cambiar. Revisa la documentación de LangGraph antes de integrar.
Para profundizar en gestión de estado con LangGraph, consulta LangGraph en la práctica: gestión de estado y LangGraph vs AutoGen: seguimiento de estado.
AutoGen, CrewAI y Temporal: colaboración multiagente y durable execution
La elección no es solo OpenAI Agents SDK frente a LangGraph. Si tu foco es la colaboración multirrol, el prototipado de investigación o una capa independiente de infraestructura de workflow, también conviene mirar AutoGen, CrewAI y Temporal.
AutoGen / AG2
AutoGen es un layered framework con Core API, AgentChat API, Extensions y Studio para construir conversaciones y aplicaciones colaborativas multiagente.
Core API cubre el runtime de agentes de bajo nivel y el enrutamiento de mensajes. AgentChat API ofrece abstracciones de conversación y colaboración de más alto nivel. Extensions integra herramientas, modelos y plataformas externas. Studio ofrece una superficie visual para construir y depurar.
Casos adecuados: investigación y prototipos de conversación/colaboración multiagente; equipos que ya conocen el ecosistema AutoGen.
Evalúa por separado: persistencia de estado, recuperación ante fallos, observabilidad, permisos y despliegue. También revisa la relación de versiones AutoGen/AG2, la estabilidad de API y la entrada de documentación en la documentación de AutoGen.
Nota sobre hechos volátiles: las migraciones entre AutoGen y AG2, la relación con Microsoft Agent Framework y la estabilidad de API pueden cambiar. Este artículo trata AutoGen como candidato de colaboración multiagente, no como una afirmación fija sobre su roadmap.
CrewAI
CrewAI organiza la colaboración multiagente mediante conceptos como crews, agents, tasks, processes y flows, con Flows para una orquestación más estructurada.
Conceptos clave: Crews agrupa agents y tasks. Agents define roles. Tasks describe el trabajo concreto. Processes define el flujo de ejecución. Flows ofrece un modelo más estructurado de orquestación multi paso.
Casos adecuados: aplicaciones de agentes con colaboración por roles; orquestación rápida y prototipos.
Evalúa por separado: módulos de producto, capacidades hospedadas, pricing y funciones enterprise. Revisa la documentación de CrewAI antes de integrar.
Nota sobre hechos volátiles: los módulos de producto, capacidades hospedadas, pricing y funciones enterprise de CrewAI pueden cambiar. Este artículo no lo clasifica como “el más fuerte”; lo ubica como candidato de colaboración multiagente.
Temporal
Temporal no es un framework de agentes. Es durable execution infrastructure. Ofrece workflow, activity, retry, timeout y visibility, por lo que sirve para procesos de negocio que deben ejecutarse de forma fiable.
Capacidades principales: Workflow define procesos de larga duración. Activity encapsula operaciones externas que pueden fallar. Retry/Timeout configura políticas de reintento y límites de tiempo. Visibility permite consultar y monitorear el estado de ejecución del workflow.
Relación con frameworks de agentes: un agente puede ser un paso dentro de un workflow o activity de Temporal. Temporal gestiona el proceso de negocio fiable; el framework de agentes gestiona los pasos inteligentes.
Casos adecuados: procesos con SLA fuerte que deben reintentar, hacer rollback y mantenerse trazables; workflows empresariales complejos que requieren cola, retry, timeout y auditoría.
Lo que no es: no es una razón para meter toda la lógica en un framework de agentes. Temporal + Agent SDK o LangGraph puede ser una separación más limpia.
Nota sobre hechos volátiles: Temporal Cloud pricing, las API SDK y las opciones de despliegue pueden cambiar. Revisa la documentación de Temporal antes de integrar.
Matriz de selección: diferencias en dimensiones de producción
La selección no es un ranking de popularidad. Es una revisión sobre siete dimensiones de ingeniería: persistencia de estado, aprobación HITL, observabilidad, presupuesto de costos, modelo de permisos, eval dataset y recuperación ante fallos. La tabla compara cinco opciones en esas dimensiones y sus límites.
| Framework | Persistencia de estado | Aprobación HITL | Observabilidad | Presupuesto de costos | Modelo de permisos | Eval dataset | Recuperación ante fallos |
|---|---|---|---|---|---|---|---|
| OpenAI Agents SDK | Sessions puede mantener contexto conversacional, pero no es graph checkpoint ni time travel | Existen HITL y guardrails, pero los flujos complejos requieren diseño en la capa de negocio | Tracing integrado; aún necesitas logs, métricas y alertas | No hay sistema completo integrado; se implementa aparte | Guardrails no es modelo completo de permisos, auditoría ni cumplimiento | Se implementa aparte | Retries, recuperación y rollback normales requieren diseño en la capa de negocio |
| LangGraph | Checkpointer + thread + checkpoint/state snapshots, con resume/replay | Interrupt + Command resume, con approve/reject/edit/review de tool calls | Puede conectarse a OpenTelemetry; aún necesitas logs, métricas y alertas | No integrado; se implementa aparte | Se implementa en nodos del graph o en la capa de negocio | Se implementa aparte | Resume o replay desde checkpoint; soporta patrones de retry y replay |
| AutoGen | Evaluar persistencia por separado | Evaluar HITL por separado | Evaluar integraciones de observabilidad por separado | Evaluar por separado | Evaluar por separado | Evaluar por separado | Evaluar por separado |
| CrewAI | Evaluar persistencia por separado | Evaluar HITL por separado | Evaluar integraciones de observabilidad por separado | Evaluar por separado | Evaluar por separado | Evaluar por separado | Evaluar por separado |
| Temporal | Workflow + activity soportan estado de workflows largos | Los workflows pueden esperar entrada humana; las aprobaciones pueden vivir en la capa workflow | Visibility integrado; conexión posible con OpenTelemetry | Control posible en la capa workflow/activity | Comprobaciones posibles en la capa workflow/activity | Se implementa aparte | Retry/timeout integrado; adecuado para ejecución fiable y recuperación |
La lectura clave: LangGraph y Temporal son más fuertes en persistencia de estado, aprobación HITL y recuperación ante fallos. OpenAI Agents SDK es más ligero, pero la gobernanza compleja de producción sigue siendo responsabilidad tuya. En observabilidad, todas las opciones necesitan logs, métricas y alertas del equipo; OpenAI Agents SDK y LangGraph ofrecen abstracciones de tracing, Temporal ofrece visibility. Presupuestos de costos, modelos de permisos y eval datasets siguen siendo responsabilidad del equipo. No asumas que un framework de agentes ya lo resolvió. AutoGen y CrewAI encajan en colaboración multirrol y prototipos, pero sus dimensiones de producción deben evaluarse aparte.
También conviene mantener claros los límites: tracing no es observabilidad completa. Guardrails no es un modelo completo de permisos, auditoría o cumplimiento. Checkpoints y threads no eliminan la necesidad de colas, bases de datos o workflow engines.
Árbol de decisión: de una demo funcional a producción
Si tu demo de agente ya funciona, pasa por este flujo antes de ponerla frente a usuarios reales.
Paso 1: juzgar la complejidad de la tarea
Pregunta: ¿tu agente es una tarea corta con poco estado, o tiene ramas y necesita pausa/reanudación?
Tarea corta / poco estado: ejemplos, pregunta puntual, búsqueda documental + resumen, procesamiento de datos de una sola vez. Empieza con OpenAI Agents SDK. Motivo: es ligero, cercano al ecosistema de modelos y herramientas de OpenAI, y no exige gestión de estado compleja.
Ramas / pausa y reanudación: ejemplos, flujo de aprobación en soporte, workflow de negocio multi paso, agente de investigación de larga duración. Pasa al segundo paso.
Paso 2: juzgar ecosistema de herramientas y necesidades de estado
Pregunta: ¿tu agente depende sobre todo del ecosistema de herramientas de OpenAI, o necesita un grafo de estado explícito?
Ecosistema OpenAI primero: si usas principalmente OpenAI Hosted tools, MCP servers y modelos OpenAI, empieza con OpenAI Agents SDK. Si además necesitas aprobaciones complejas o replay de estado, evalúa LangGraph o la combinación Temporal + Agents SDK.
Grafo de estado explícito necesario: si hay ramas complejas, recuperación, pausas de aprobación y replay de estado, elige LangGraph. Asume mayor complejidad de ingeniería porque debes diseñar y mantener el grafo de estado.
Paso 3: juzgar gobernanza de producción
Pregunta: ¿es un prototipo de investigación, o necesita gobernanza de producción?
Prototipo de investigación: para investigación de conversación/colaboración multiagente, o equipos que ya conocen AutoGen/CrewAI, evalúa AutoGen y CrewAI. Revisa aparte persistencia, recuperación, observabilidad, permisos y despliegue.
Gobernanza de producción: para procesos con SLA fuerte que deben reintentar, hacer rollback y seguir siendo trazables, considera LangGraph + Temporal. Temporal gestiona el workflow de negocio fiable externo; LangGraph gestiona el grafo de estado del agente y la orquestación LLM.
Punto de decisión
Sea cual sea el framework, añade estas capacidades antes del lanzamiento:
| Capacidad | Checklist |
|---|---|
| Persistencia de estado | ¿Hay checkpoints/threads? ¿Puedes hacer resume o replay? |
| Aprobación HITL | ¿Hay interrupt/Command resume? ¿El flujo de aprobación está completo? |
| Observabilidad | ¿El tracing está conectado a logs, métricas y alertas del equipo? |
| Presupuesto de costos | ¿Hay límites de presupuesto, seguimiento de costos y alertas? |
| Modelo de permisos | ¿Hay aislamiento de permisos, logs de auditoría y aprobación de cumplimiento? |
| Eval dataset | ¿Hay pruebas de regresión, eval datasets y definición de métricas? |
| Recuperación ante fallos | ¿Hay lógica de retry, planes de rollback y rutas de intervención humana? |
Siguiente paso: si eliges OpenAI Agents SDK, todavía debes conectar logs, métricas, alertas, presupuestos, permisos, eval datasets y recuperación ante fallos. Si eliges LangGraph, diseña el grafo de estado, elige un backend de persistencia y conecta observabilidad, costos, permisos y evals. Si eliges Temporal más un framework de agentes, define workflows y activities, configura retry/timeout y conecta observabilidad, costos y permisos.
Siguientes pasos y lecturas relacionadas
Cuando tengas una dirección de framework, profundiza por dimensión de ingeniería:
Artículos existentes de BetterLink: Desarrollo de agentes de IA en la práctica: guía de arquitectura e implementación sirve como base de arquitectura de agentes, con límites de componentes, tool calling y diseño de estado. LangGraph en la práctica: gestión de estado explica checkpoints, threads, resume/replay y recuperación ante fallos. LangGraph vs AutoGen: seguimiento de estado compara los dos enfoques de state tracking. Monitoreo, alertas y recuperación ante fallos para agentes de IA profundiza en logs, alertas, recovery e intervención humana. Diseño de sistemas de memoria para agentes es el siguiente paso para memoria de corto/largo plazo y gestión de contexto.
Los próximos artículos de esta serie desglosarán context engineering, flujos de aprobación HITL, presupuestos y control de costos, modelos de permisos, diseño de state machine, eval datasets y pruebas de regresión, y la checklist completa de lanzamiento de demo a producción.
Si todavía estás eligiendo, empieza por el árbol de decisión: complejidad de la tarea, ecosistema de herramientas y necesidades de estado. No te quedes en “la demo funciona”. Antes del lanzamiento, revisa persistencia de estado, aprobación HITL, observabilidad, presupuestos de costos, modelos de permisos, eval datasets y recuperación ante fallos.
Cómo elegir una stack de ingeniería para agentes de IA
Un flujo de selección para pasar de una demo funcional a producción, decidiendo el framework principal, el workflow engine externo y las piezas de gobernanza que faltan.
⏱️ Estimated time: 30 min
- 1
Step 1: Decidir si la tarea es una sesión corta o un workflow largo
Comprueba si el trabajo es una pregunta puntual, una búsqueda o un resumen, o si atraviesa varios pasos, aprobaciones humanas, esperas y recuperación. - 2
Step 2: Listar los requisitos de gobernanza en producción
Escribe de forma explícita estado, aprobaciones, permisos de herramientas, recuperación ante fallos, presupuesto, trace/audit y eval datasets. - 3
Step 3: Mapear el límite de responsabilidad de cada framework
Usa OpenAI Agents SDK, LangGraph, AutoGen/CrewAI y Temporal para separar primitivas ligeras de agente, grafos de estado, colaboración multirrol y workflows fiables. - 4
Step 4: Probar con una tarea real de negocio
Usa una tarea real para validar trazas, retries, intervención humana, aislamiento de permisos y pruebas de regresión, en vez de quedarte en una demo hello world. - 5
Step 5: Decidir el framework principal y los sistemas que faltan
Decide qué framework de agentes gestiona los pasos inteligentes, qué workflow engine asume la fiabilidad y cómo se implementan observabilidad, costos y permisos.
FAQ
¿LangGraph y OpenAI Agents SDK se sustituyen entre sí?
¿Un agente de producción siempre necesita LangGraph?
¿AutoGen y CrewAI siguen valiendo la pena?
¿Cómo se reparten Temporal y LangGraph las responsabilidades?
¿Qué se suele olvidar al elegir un framework de agentes de IA?
14 min de lectura · Publicado el: 11 sep 2026 · Actualizado el: 11 sep 2026
Guía de ingeniería de AI Agents
Si llegaste desde búsqueda, lo más rápido es ir al artículo anterior o siguiente de esta misma serie.
Anterior
Arquitectura DeepAgents: herramientas de planificación, subagentes y sistema de archivos
Análisis en profundidad de los cuatro pilares de DeepAgents: Planning Tools, Sub-agents, File System y System Prompts. Comparación con LangGraph, AutoGen y otros frameworks, con ejemplos de código y buenas prácticas.
Parte 16 de 22
Siguiente
Context engineering para agentes de IA: cómo separar System Prompt, Memory, Tools y Files
Un marco práctico para dividir el contexto de un agente entre system prompt, reglas de desarrollo, memory, files, retrieval, tool schema, runtime state y output contract, evitando que las reglas se diluyan en ejecuciones largas.
Parte 18 de 22



Comentarios
Inicia sesión con GitHub para dejar un comentario