Cambiar tema

Ingeniería de agentes de IA en 2026: cómo elegir entre LangGraph y OpenAI Agents SDK

Easton editorial illustration: one central state ledger with three controlled graph branches
7
Dimensiones de producción
Persistencia de estado, aprobación HITL, observabilidad, presupuesto de costos, modelo de permisos, eval dataset y recuperación ante fallos.
5
Opciones comparadas
OpenAI Agents SDK, LangGraph, AutoGen, CrewAI y Temporal.
3
Pasos de decisión
Primero complejidad de la tarea, luego ecosistema de herramientas y estado, y después gobernanza de producción.
数据来源: Dimensiones de selección definidas en este artículo a partir de la investigación oficial de la etapa 1

"Documentación de OpenAI Agents SDK"

Una demo de agente para investigación de clientes ya puede buscar documentación, resumir resultados y enviar un mensaje a Lark. El problema aparece cuando el equipo intenta llevarla a producción: faltan colas, aprobaciones, recuperación ante fallos, logs, límites de costo y pruebas de regresión. Cuando producto pregunta si operaciones puede usarlo la semana siguiente, el desarrollador entiende que elegir entre LangGraph y OpenAI Agents SDK no va de qué demo corre más rápido. Va de siete dimensiones de ingeniería: persistencia de estado, aprobación humana, observabilidad, presupuesto de costos, modelo de permisos, eval dataset y recuperación ante fallos.

OpenAI Agents SDK: la opción ligera primero

OpenAI Agents SDK es una herramienta ligera, code-first, para construir agentes cerca del ecosistema de modelos y llamadas a herramientas de OpenAI.

Sus primitivas principales son:

PrimitivaQué haceLímite
AgentsUnidad compuesta por instructions, model, tools, MCP servers, handoffs y guardrailsNo es un grafo de estado explícito; el estado de negocio se diseña aparte
HandoffsMecanismo multiagente para que un agente entregue una tarea a otroNo equivale a control de workflow de larga duración
GuardrailsGuardrails input/output que ejecutan comprobaciones en paralelo y lanzan excepción cuando se activa un tripwireNo equivalen a modelo completo de permisos, auditoría o aprobación de cumplimiento
TracingTraces/spans integrados, con processor personalizado y control de datos sensiblesNo equivale a sistema completo de monitoreo, alertas, presupuesto o rollback
ToolsSoporta OpenAI Hosted tools, herramientas de función personalizadas y MCP serversLos tipos concretos de herramientas y el soporte MCP deben revisarse en la documentación actual
Sessions / HITLLa documentación oficial incluye entradas para sessions, human-in-the-loop y sandbox agentsNo equivale a graph checkpointing, time travel o replay al estilo LangGraph

Si necesitas construir rápido un agente ligero en código, depender sobre todo de modelos y herramientas de OpenAI, tener handoffs multiagente, guardrails alrededor de entradas y salidas, tracing del SDK y menor complejidad de framework, OpenAI Agents SDK es la opción más ligera. Ejemplos: atención al cliente, búsqueda documental + resumen, o varios agentes que procesan tareas en secuencia.

El costo es la responsabilidad. Guardrails puede validar entradas y salidas, pero los flujos de aprobación complejos, el aislamiento de permisos y los logs de auditoría siguen en la capa de negocio. Tracing puede conectarse a OpenTelemetry o a un processor propio, pero el equipo todavía necesita logs, métricas, alertas, presupuesto de costos y pruebas de regresión. Sessions y HITL cubren parte de la conversación y de la intervención humana. Si necesitas un grafo de estado explícito, checkpoints, resume/replay, time travel o control de workflows largos, todavía debes evaluar LangGraph, Temporal o una capa propia de estado de negocio.

No encaja bien en escenarios con ramas de estado complejas, pausas y reanudación tras aprobación, procesos con SLA fuerte que exigen retry, rollback y trazabilidad, o workflows que requieren replay de estado y orquestación de larga duración.

Nota sobre hechos volátiles: la API de OpenAI Agents SDK, los modelos por defecto, Hosted tools, soporte MCP, sessions, sandbox agents, comportamiento de tracing y precios pueden cambiar. Revisa la documentación de OpenAI Agents SDK antes de integrar.

LangGraph: fuerte en estado explícito y persistencia

LangGraph es un low-level orchestration framework para stateful agents. Su foco está en durable execution, HITL, memory y time travel.

Capacidades principales:

CapacidadQué significaUso típico
Durable executionPersiste threads y checkpoint/state snapshots mediante un checkpointerReanudar o reproducir desde un checkpoint después de un fallo
Human-in-the-loopUsa interrupt para pausar y Command resume para continuar; permite approve/reject/edit/review de tool callsFlujos de aprobación complejos y revisión humana de acciones sensibles
MemoryOfrece comprehensive memory para contexto de corto y largo plazoDiseño de sistemas de memoria de agentes
Time travelReproduce o hace fork desde checkpoints históricosReproducir ejecuciones fallidas y comparar ramas

Mecánica de persistencia

La persistencia de LangGraph no es solo historial de chat. Se organiza alrededor de threads y checkpoints:

Thread: el hilo de ejecución de una conversación o workflow. Checkpoint: una instantánea completa del estado en un momento concreto, incluidos graph state, pending tasks y pending writes. Resume/Replay: continuar desde un checkpoint o reproducir una ruta histórica de ejecución.

Este modelo encaja cuando hacen falta pausa/reanudación, reintentos tras fallo y replay de estado. Por ejemplo: flujos de aprobación en soporte, workflows de negocio multi paso o agentes de investigación de larga duración.

Human-in-the-loop(HITL)

El HITL de LangGraph está más cerca de pausar y reanudar un workflow con estado:

Interrupt pausa la ejecución en un nodo y espera entrada humana. Command resume continúa después de que una persona apruebe, rechace o edite. Tool-call review puede pausar antes de una llamada a herramienta para pedir aprobación.

Comparado con los guardrails de OpenAI Agents SDK, los guardrails son más bien comprobaciones antes o después de una ejecución. El HITL de LangGraph pausa y reanuda en medio del workflow. Si tu flujo de aprobación necesita varios turnos, estado guardado, replay y ramas, LangGraph suele encajar mejor.

Si necesitas ramas de estado complejas, recuperación, pausas de aprobación y replay de estado, LangGraph está más cerca de una orquestación de producción. Ejemplos: flujos de aprobación en soporte, workflows de negocio multi paso y agentes de investigación de larga duración.

El costo es la complejidad. Tienes que diseñar y mantener un grafo de estado. También debes elegir un backend de persistencia, y el soporte puede cambiar; por eso conviene revisar la documentación actual antes de integrar.

No encaja tan bien en tareas cortas, prototipos con poco estado o proyectos que dependen sobre todo del ecosistema de herramientas de OpenAI y no necesitan persistencia ni aprobaciones complejas.

Nota sobre hechos volátiles: LangGraph v1, Platform/Studio/Deployment y el soporte de backends de persistencia pueden cambiar. Revisa la documentación de LangGraph antes de integrar.

Para profundizar en gestión de estado con LangGraph, consulta LangGraph en la práctica: gestión de estado y LangGraph vs AutoGen: seguimiento de estado.

AutoGen, CrewAI y Temporal: colaboración multiagente y durable execution

La elección no es solo OpenAI Agents SDK frente a LangGraph. Si tu foco es la colaboración multirrol, el prototipado de investigación o una capa independiente de infraestructura de workflow, también conviene mirar AutoGen, CrewAI y Temporal.

AutoGen / AG2

AutoGen es un layered framework con Core API, AgentChat API, Extensions y Studio para construir conversaciones y aplicaciones colaborativas multiagente.

Core API cubre el runtime de agentes de bajo nivel y el enrutamiento de mensajes. AgentChat API ofrece abstracciones de conversación y colaboración de más alto nivel. Extensions integra herramientas, modelos y plataformas externas. Studio ofrece una superficie visual para construir y depurar.

Casos adecuados: investigación y prototipos de conversación/colaboración multiagente; equipos que ya conocen el ecosistema AutoGen.

Evalúa por separado: persistencia de estado, recuperación ante fallos, observabilidad, permisos y despliegue. También revisa la relación de versiones AutoGen/AG2, la estabilidad de API y la entrada de documentación en la documentación de AutoGen.

Nota sobre hechos volátiles: las migraciones entre AutoGen y AG2, la relación con Microsoft Agent Framework y la estabilidad de API pueden cambiar. Este artículo trata AutoGen como candidato de colaboración multiagente, no como una afirmación fija sobre su roadmap.

CrewAI

CrewAI organiza la colaboración multiagente mediante conceptos como crews, agents, tasks, processes y flows, con Flows para una orquestación más estructurada.

Conceptos clave: Crews agrupa agents y tasks. Agents define roles. Tasks describe el trabajo concreto. Processes define el flujo de ejecución. Flows ofrece un modelo más estructurado de orquestación multi paso.

Casos adecuados: aplicaciones de agentes con colaboración por roles; orquestación rápida y prototipos.

Evalúa por separado: módulos de producto, capacidades hospedadas, pricing y funciones enterprise. Revisa la documentación de CrewAI antes de integrar.

Nota sobre hechos volátiles: los módulos de producto, capacidades hospedadas, pricing y funciones enterprise de CrewAI pueden cambiar. Este artículo no lo clasifica como “el más fuerte”; lo ubica como candidato de colaboración multiagente.

Temporal

Temporal no es un framework de agentes. Es durable execution infrastructure. Ofrece workflow, activity, retry, timeout y visibility, por lo que sirve para procesos de negocio que deben ejecutarse de forma fiable.

Capacidades principales: Workflow define procesos de larga duración. Activity encapsula operaciones externas que pueden fallar. Retry/Timeout configura políticas de reintento y límites de tiempo. Visibility permite consultar y monitorear el estado de ejecución del workflow.

Relación con frameworks de agentes: un agente puede ser un paso dentro de un workflow o activity de Temporal. Temporal gestiona el proceso de negocio fiable; el framework de agentes gestiona los pasos inteligentes.

Casos adecuados: procesos con SLA fuerte que deben reintentar, hacer rollback y mantenerse trazables; workflows empresariales complejos que requieren cola, retry, timeout y auditoría.

Lo que no es: no es una razón para meter toda la lógica en un framework de agentes. Temporal + Agent SDK o LangGraph puede ser una separación más limpia.

Nota sobre hechos volátiles: Temporal Cloud pricing, las API SDK y las opciones de despliegue pueden cambiar. Revisa la documentación de Temporal antes de integrar.

Matriz de selección: diferencias en dimensiones de producción

La selección no es un ranking de popularidad. Es una revisión sobre siete dimensiones de ingeniería: persistencia de estado, aprobación HITL, observabilidad, presupuesto de costos, modelo de permisos, eval dataset y recuperación ante fallos. La tabla compara cinco opciones en esas dimensiones y sus límites.

FrameworkPersistencia de estadoAprobación HITLObservabilidadPresupuesto de costosModelo de permisosEval datasetRecuperación ante fallos
OpenAI Agents SDKSessions puede mantener contexto conversacional, pero no es graph checkpoint ni time travelExisten HITL y guardrails, pero los flujos complejos requieren diseño en la capa de negocioTracing integrado; aún necesitas logs, métricas y alertasNo hay sistema completo integrado; se implementa aparteGuardrails no es modelo completo de permisos, auditoría ni cumplimientoSe implementa aparteRetries, recuperación y rollback normales requieren diseño en la capa de negocio
LangGraphCheckpointer + thread + checkpoint/state snapshots, con resume/replayInterrupt + Command resume, con approve/reject/edit/review de tool callsPuede conectarse a OpenTelemetry; aún necesitas logs, métricas y alertasNo integrado; se implementa aparteSe implementa en nodos del graph o en la capa de negocioSe implementa aparteResume o replay desde checkpoint; soporta patrones de retry y replay
AutoGenEvaluar persistencia por separadoEvaluar HITL por separadoEvaluar integraciones de observabilidad por separadoEvaluar por separadoEvaluar por separadoEvaluar por separadoEvaluar por separado
CrewAIEvaluar persistencia por separadoEvaluar HITL por separadoEvaluar integraciones de observabilidad por separadoEvaluar por separadoEvaluar por separadoEvaluar por separadoEvaluar por separado
TemporalWorkflow + activity soportan estado de workflows largosLos workflows pueden esperar entrada humana; las aprobaciones pueden vivir en la capa workflowVisibility integrado; conexión posible con OpenTelemetryControl posible en la capa workflow/activityComprobaciones posibles en la capa workflow/activitySe implementa aparteRetry/timeout integrado; adecuado para ejecución fiable y recuperación

La lectura clave: LangGraph y Temporal son más fuertes en persistencia de estado, aprobación HITL y recuperación ante fallos. OpenAI Agents SDK es más ligero, pero la gobernanza compleja de producción sigue siendo responsabilidad tuya. En observabilidad, todas las opciones necesitan logs, métricas y alertas del equipo; OpenAI Agents SDK y LangGraph ofrecen abstracciones de tracing, Temporal ofrece visibility. Presupuestos de costos, modelos de permisos y eval datasets siguen siendo responsabilidad del equipo. No asumas que un framework de agentes ya lo resolvió. AutoGen y CrewAI encajan en colaboración multirrol y prototipos, pero sus dimensiones de producción deben evaluarse aparte.

También conviene mantener claros los límites: tracing no es observabilidad completa. Guardrails no es un modelo completo de permisos, auditoría o cumplimiento. Checkpoints y threads no eliminan la necesidad de colas, bases de datos o workflow engines.

Árbol de decisión: de una demo funcional a producción

Si tu demo de agente ya funciona, pasa por este flujo antes de ponerla frente a usuarios reales.

Paso 1: juzgar la complejidad de la tarea

Pregunta: ¿tu agente es una tarea corta con poco estado, o tiene ramas y necesita pausa/reanudación?

Tarea corta / poco estado: ejemplos, pregunta puntual, búsqueda documental + resumen, procesamiento de datos de una sola vez. Empieza con OpenAI Agents SDK. Motivo: es ligero, cercano al ecosistema de modelos y herramientas de OpenAI, y no exige gestión de estado compleja.

Ramas / pausa y reanudación: ejemplos, flujo de aprobación en soporte, workflow de negocio multi paso, agente de investigación de larga duración. Pasa al segundo paso.

Paso 2: juzgar ecosistema de herramientas y necesidades de estado

Pregunta: ¿tu agente depende sobre todo del ecosistema de herramientas de OpenAI, o necesita un grafo de estado explícito?

Ecosistema OpenAI primero: si usas principalmente OpenAI Hosted tools, MCP servers y modelos OpenAI, empieza con OpenAI Agents SDK. Si además necesitas aprobaciones complejas o replay de estado, evalúa LangGraph o la combinación Temporal + Agents SDK.

Grafo de estado explícito necesario: si hay ramas complejas, recuperación, pausas de aprobación y replay de estado, elige LangGraph. Asume mayor complejidad de ingeniería porque debes diseñar y mantener el grafo de estado.

Paso 3: juzgar gobernanza de producción

Pregunta: ¿es un prototipo de investigación, o necesita gobernanza de producción?

Prototipo de investigación: para investigación de conversación/colaboración multiagente, o equipos que ya conocen AutoGen/CrewAI, evalúa AutoGen y CrewAI. Revisa aparte persistencia, recuperación, observabilidad, permisos y despliegue.

Gobernanza de producción: para procesos con SLA fuerte que deben reintentar, hacer rollback y seguir siendo trazables, considera LangGraph + Temporal. Temporal gestiona el workflow de negocio fiable externo; LangGraph gestiona el grafo de estado del agente y la orquestación LLM.

Punto de decisión

Sea cual sea el framework, añade estas capacidades antes del lanzamiento:

CapacidadChecklist
Persistencia de estado¿Hay checkpoints/threads? ¿Puedes hacer resume o replay?
Aprobación HITL¿Hay interrupt/Command resume? ¿El flujo de aprobación está completo?
Observabilidad¿El tracing está conectado a logs, métricas y alertas del equipo?
Presupuesto de costos¿Hay límites de presupuesto, seguimiento de costos y alertas?
Modelo de permisos¿Hay aislamiento de permisos, logs de auditoría y aprobación de cumplimiento?
Eval dataset¿Hay pruebas de regresión, eval datasets y definición de métricas?
Recuperación ante fallos¿Hay lógica de retry, planes de rollback y rutas de intervención humana?

Siguiente paso: si eliges OpenAI Agents SDK, todavía debes conectar logs, métricas, alertas, presupuestos, permisos, eval datasets y recuperación ante fallos. Si eliges LangGraph, diseña el grafo de estado, elige un backend de persistencia y conecta observabilidad, costos, permisos y evals. Si eliges Temporal más un framework de agentes, define workflows y activities, configura retry/timeout y conecta observabilidad, costos y permisos.

Siguientes pasos y lecturas relacionadas

Cuando tengas una dirección de framework, profundiza por dimensión de ingeniería:

Artículos existentes de BetterLink: Desarrollo de agentes de IA en la práctica: guía de arquitectura e implementación sirve como base de arquitectura de agentes, con límites de componentes, tool calling y diseño de estado. LangGraph en la práctica: gestión de estado explica checkpoints, threads, resume/replay y recuperación ante fallos. LangGraph vs AutoGen: seguimiento de estado compara los dos enfoques de state tracking. Monitoreo, alertas y recuperación ante fallos para agentes de IA profundiza en logs, alertas, recovery e intervención humana. Diseño de sistemas de memoria para agentes es el siguiente paso para memoria de corto/largo plazo y gestión de contexto.

Los próximos artículos de esta serie desglosarán context engineering, flujos de aprobación HITL, presupuestos y control de costos, modelos de permisos, diseño de state machine, eval datasets y pruebas de regresión, y la checklist completa de lanzamiento de demo a producción.

Si todavía estás eligiendo, empieza por el árbol de decisión: complejidad de la tarea, ecosistema de herramientas y necesidades de estado. No te quedes en “la demo funciona”. Antes del lanzamiento, revisa persistencia de estado, aprobación HITL, observabilidad, presupuestos de costos, modelos de permisos, eval datasets y recuperación ante fallos.

Cómo elegir una stack de ingeniería para agentes de IA

Un flujo de selección para pasar de una demo funcional a producción, decidiendo el framework principal, el workflow engine externo y las piezas de gobernanza que faltan.

⏱️ Estimated time: 30 min

  1. 1

    Step 1: Decidir si la tarea es una sesión corta o un workflow largo

    Comprueba si el trabajo es una pregunta puntual, una búsqueda o un resumen, o si atraviesa varios pasos, aprobaciones humanas, esperas y recuperación.
  2. 2

    Step 2: Listar los requisitos de gobernanza en producción

    Escribe de forma explícita estado, aprobaciones, permisos de herramientas, recuperación ante fallos, presupuesto, trace/audit y eval datasets.
  3. 3

    Step 3: Mapear el límite de responsabilidad de cada framework

    Usa OpenAI Agents SDK, LangGraph, AutoGen/CrewAI y Temporal para separar primitivas ligeras de agente, grafos de estado, colaboración multirrol y workflows fiables.
  4. 4

    Step 4: Probar con una tarea real de negocio

    Usa una tarea real para validar trazas, retries, intervención humana, aislamiento de permisos y pruebas de regresión, en vez de quedarte en una demo hello world.
  5. 5

    Step 5: Decidir el framework principal y los sistemas que faltan

    Decide qué framework de agentes gestiona los pasos inteligentes, qué workflow engine asume la fiabilidad y cómo se implementan observabilidad, costos y permisos.

FAQ

¿LangGraph y OpenAI Agents SDK se sustituyen entre sí?
No del todo. OpenAI Agents SDK está más cerca de primitivas ligeras de agente, llamadas a herramientas, handoffs multiagente, guardrails, tracing, sessions y HITL. LangGraph está más cerca de grafos de estado explícitos, persistencia, pausas/reanudación y workflows que se pueden reproducir. En sistemas reales pueden combinarse.
¿Un agente de producción siempre necesita LangGraph?
No. Para tareas cortas, con poco estado y centradas sobre todo en el ecosistema de herramientas de OpenAI, Agents SDK puede ser más ligero. LangGraph gana valor cuando aparecen ramas, recuperación, pausas de aprobación o replay de estado.
¿AutoGen y CrewAI siguen valiendo la pena?
Sí, si el foco es la colaboración multirrol, los prototipos de investigación o un equipo que ya conoce ese ecosistema. Antes de producción, evalúa por separado persistencia, recuperación, observabilidad, permisos, costos y límites de despliegue.
¿Cómo se reparten Temporal y LangGraph las responsabilidades?
Temporal es infraestructura de durable execution para workflows de negocio fiables. LangGraph gestiona grafos de estado de agentes y orquestación LLM. En procesos con SLA fuerte, Temporal puede encargarse de workflows, activities, retries y timeouts, mientras el framework de agentes gestiona los pasos inteligentes.
¿Qué se suele olvidar al elegir un framework de agentes de IA?
Se suelen olvidar aprobaciones HITL, reintentos, trace/audit, presupuestos de costo, modelos de permisos, eval datasets y planes de rollback. Esas brechas rara vez aparecen en una demo.

14 min de lectura · Publicado el: 11 sep 2026 · Actualizado el: 11 sep 2026

Comentarios

Inicia sesión con GitHub para dejar un comentario

Easton BlogEaston Blog