切换主题

2026 AI Agent 工程化全景:从 LangGraph 到 OpenAI Agents SDK 怎么选

Easton editorial illustration: one central state ledger with three controlled graph branches
7
生产选型维度
状态持久化、HITL 审批、观测性、成本预算、权限模型、eval dataset、失败恢复。
5
对比对象
OpenAI Agents SDK、LangGraph、AutoGen、CrewAI、Temporal。
3
决策步骤
先看任务复杂度,再看工具生态和状态需求,最后看生产治理。
数据来源: 本文自定义选型维度,基于阶段一官方文档调研整理

"OpenAI Agents SDK Documentation"

客服调研 Agent demo 已经能查文档、总结结果、发飞书消息。但准备上线时,团队才发现还缺排队、审批、失败恢复、日志、成本上限和回归测试。产品经理问“能不能下周给运营团队用”,开发者意识到:选 LangGraph 还是 OpenAI Agents SDK,不是看 demo 能跑多快,而是看状态持久化、人工审批、观测性、成本预算、权限模型、eval dataset 和失败恢复这七个工程维度。

OpenAI Agents SDK:轻量优先的选择

OpenAI Agents SDK 是轻量、代码优先的 Agent 构建工具,贴近 OpenAI 模型与工具调用生态。

核心原语包括:

原语说明边界
Agentsinstructions、model、tools、MCP servers、handoffs、guardrails 的组合单元不是显式状态图,每次运行的业务状态仍要自己设计
Handoffs多 Agent 交接机制,一个 Agent 可将任务 handoff 给另一个不等于长期运行 workflow 控制
Guardrailsinput/output guardrails,并行检查,触发 tripwire 后抛异常不等于完整权限模型、审计日志或合规审批流
Tracing内置 traces/spans,支持自定义 processor、敏感数据控制不等于完整监控、告警、成本预算或回滚系统
Tools支持 OpenAI Hosted tools、自定义函数工具、MCP servers具体工具类型和 MCP 支持需回查官方文档
Sessions / HITL官方文档已有 sessions、human-in-the-loop 和 sandbox agents 等能力入口不等于 LangGraph 式 graph checkpoint、time travel 和 replay

如果你需要快速构建一个轻量代码型 Agent,主要依赖 OpenAI 模型和工具调用生态,需要多 Agent handoff、结果前后加护栏、SDK 内置 tracing 和较低的框架复杂度,OpenAI Agents SDK 是较轻的选择。例如:客服问答、文档检索 + 总结、多 Agent 依次处理。

代价与边界:Guardrails 可以做输入输出校验,但复杂审批流、权限隔离、审计日志仍需业务层自己实现。Tracing 能接入 OpenTelemetry 或自定义 processor,但团队的日志、指标、告警、成本预算、回归测试需自己接。Sessions 和 HITL 能补一部分会话与人工介入能力,但如果你需要显式状态图、checkpoint、resume/replay、time travel 或长期 workflow 控制,仍要评估 LangGraph、Temporal 或业务层状态系统。

不适合的场景:复杂状态分支,需要暂停恢复、人工审批后继续执行;强 SLA 业务流程,必须保证失败后重试、回滚、可追溯;需要状态回放、时间旅行、长期运行 workflow 控制。

易变事实提醒:OpenAI Agents SDK 的 API、默认模型、Hosted tools、MCP 支持、sessions、sandbox agents、tracing 默认行为和价格都可能变化。集成前应回查 OpenAI Agents SDK 官方文档

LangGraph:显式状态与持久化的强项

LangGraph 是 low-level orchestration framework,用于 stateful agents,强调 durable execution、HITL、memory、time travel。

核心能力:

能力说明典型用途
Durable execution通过 checkpointer 持久化 thread、checkpoint/state snapshots失败后可从 checkpoint resume 或 replay
Human-in-the-loopinterrupt 暂停执行,Command resume 恢复,可 approve/reject/edit/review tool calls复杂审批流、人工确认敏感操作
Memorycomprehensive memory,可保存短期/长期上下文Agent 记忆系统设计
Time travel可从历史 checkpoint replay 或 fork回放失败执行、对比不同分支结果

持久化机制

LangGraph 的持久化不是简单聊天历史,而是围绕 thread 和 checkpoint:

Thread:一次对话或 workflow 的执行线程。Checkpoint:某个时刻的完整状态快照,包括 graph state、pending tasks、pending writes。Resume/Replay:从某个 checkpoint 恢复执行,或回放历史执行路径。

这种机制适合需要暂停恢复、失败重试、状态回放的场景。例如:客服审批流程、多步骤业务 workflow、长期运行的研究 Agent。

Human-in-the-loop(HITL)

LangGraph 的 HITL 更贴近有状态 workflow 暂停/恢复:

Interrupt:在某个节点暂停执行,等待人工输入。Command resume:人工 approve/reject/edit 后,用 Command 对象恢复执行。Tool call review:可在执行某个 tool call 前暂停,让人工审批。

对比 OpenAI Agents SDK 的 guardrails:Guardrails 更偏运行前后校验,LangGraph HITL 更偏 workflow 中间暂停/恢复。如果你的审批流需要多轮对话、状态保存、回放和分支,LangGraph 更合适。

如果你需要复杂状态分支、可恢复、需要暂停审批和状态回放,LangGraph 是更贴近生产的选择。例如:客服审批流程、多步骤业务 workflow、长期运行的研究 Agent。

代价:工程复杂度更高,需要设计和维护状态图。需要选择 persistence 后端,后端支持范围可能变化,集成前应核验官方文档。

不适合的场景:短任务、少状态、快速原型。主要依赖 OpenAI 工具生态,不需要持久化或复杂审批。

易变事实提醒:LangGraph v1、Platform/Studio/Deployment、persistence 后端支持可能变化。集成前应回查 LangGraph 官方文档

关于 LangGraph 状态管理的详细机制,见站内文章:LangGraph 状态管理实战LangGraph vs AutoGen 状态追踪对比

AutoGen、CrewAI、Temporal:多 agent 与 durable execution 的补充

选型不是只有 OpenAI Agents SDK 和 LangGraph 二选一。如果你的重点是多角色协作、研究原型或需要独立的工作流基础设施,还需要看 AutoGen、CrewAI 和 Temporal。

AutoGen / AG2

AutoGen 是 layered framework,包含 Core API、AgentChat API、Extensions 和 Studio,面向多 agent 对话和协作应用。

核心能力:Core API 是底层 agent runtime 和消息路由,AgentChat API 是高层对话和协作抽象,Extensions 是与外部工具、模型、平台的集成层,Studio 是可视化构建和调试工具。

适用场景:多 agent 对话/协作研究和原型;团队已经熟悉 AutoGen 生态。

需要单独评估:状态持久化、失败恢复、观测、权限和部署。AutoGen 与 AG2 的版本关系、API 稳定性、文档入口。集成前应核验 AutoGen 官方文档

易变事实提醒:AutoGen 与 AG2 的版本迁移、与 Microsoft Agent Framework 的关系、API 稳定性都可能变化。本文只把它作为多 agent 协作候选,不把版本路线写成强结论。

CrewAI

CrewAI 以 crews、agents、tasks、processes、flows 等概念组织多 agent 协作,并提供 Flows 等结构化能力。

核心概念:Crews 是一组 agents 和 tasks 的组合,Agents 是角色定义,Tasks 是具体任务,Processes 是任务执行流程,Flows 是更结构化的多步骤编排。

适用场景:角色协作型 Agent 应用;快速编排和原型。

需要单独评估:产品模块、托管能力、pricing、enterprise 特性。集成前应核验 CrewAI 官方文档

易变事实提醒:CrewAI 的产品模块、托管能力、pricing、enterprise 特性可能变化。本文不评价它“是否最强”,只放入多 agent 协作候选维度。

Temporal

Temporal 不是 Agent 框架,是 durable execution infrastructure。它提供 workflow、activity、retry、timeout、visibility 等能力,适合承载“必须可靠执行”的业务流程。

核心能力:Workflow 是长期运行流程的定义,Activity 是可能失败的外部操作封装,Retry/Timeout 是可配置的重试策略和超时控制,Visibility 是 workflow 执行状态的查询和监控。

与 Agent 框架的关系:Agent 可以作为 Temporal workflow 或 activity 中的一步。Temporal 管外层可靠业务流程,Agent 框架管智能步骤。

适用场景:强 SLA 业务流程,必须保证失败后重试、回滚、可追溯;复杂企业流程,需要队列、重试、超时、审计。

不等于:不是把所有逻辑塞进 Agent 框架。Temporal + Agent SDK/LangGraph 可能是更合理的组合。

易变事实提醒:Temporal Cloud pricing、SDK API、部署方式可能变化。集成前应核验 Temporal 官方文档

选型维度矩阵:一眼看明各框架在生产维度的差异

选型不是看热度榜,而是看七个工程维度:状态持久化、HITL 审批、观测性、成本预算、权限模型、eval dataset、失败恢复。以下表格对比五个框架在这些维度的能力和边界。

框架状态持久化HITL 审批观测性成本预算权限模型Eval dataset失败恢复
OpenAI Agents SDKSessions 可维护会话上下文,但不是 graph checkpoint/time travel有 HITL/guardrails 能力入口,复杂审批流仍需业务层设计内置 tracing,需要自己接日志/指标/告警无完整内置预算系统,需自己接Guardrails 不等于完整权限模型、审计日志或合规审批需自己实现普通重试、恢复和回滚仍需业务层设计
LangGraphCheckpointer + thread + checkpoint/state snapshots,可 resume/replayInterrupt + Command resume,可 approve/reject/edit/review tool calls可接入 OpenTelemetry,需自己接日志/指标/告警无内置,需自己接需在 graph 节点或业务层实现需自己实现从 checkpoint resume 或 replay,支持重试和回放
AutoGen需单独评估状态持久化能力需单独评估 HITL 能力需单独评估观测性集成需单独评估需单独评估需单独评估需单独评估
CrewAI需单独评估状态持久化能力需单独评估 HITL 能力需单独评估观测性集成需单独评估需单独评估需单独评估需单独评估
TemporalWorkflow + activity,支持长期 workflow 状态Workflow 可暂停等待人工输入,审批流可在 workflow 层实现内置 visibility,可接入 OpenTelemetry可在 workflow/activity 层实现预算控制Workflow/activity 层可实现权限检查需自己实现内置 retry/timeout,适合可靠执行和恢复

关键判断:状态持久化、HITL 审批、失败恢复方面,LangGraph 和 Temporal 更强;OpenAI Agents SDK 更轻,但复杂生产治理仍要自己接。观测性方面,所有框架都需要自己接团队的日志、指标、告警;OpenAI Agents SDK 和 LangGraph 有 tracing 抽象,Temporal 有 visibility 抽象。成本预算、权限模型、eval dataset 方面,所有框架都需要自己实现;不要默认某个 Agent 框架已经替你解决。AutoGen、CrewAI 适合多角色协作和原型,但生产维度需单独评估。

不等于:Tracing 不等于完整可观测性。Guardrails 不等于完整权限模型、审计日志或合规审批流。Checkpoint/thread 不等于不需要队列、数据库或工作流引擎。

场景决策树:从 demo 跑通后到上线的路径

如果你的 Agent demo 已经能跑,准备上线前先走一遍这个决策流程。

第一步:判断任务复杂度

问题:你的 Agent 是短任务/少状态,还是多分支/需要暂停恢复?

短任务/少状态:例如单次问答、文档检索 + 总结、一次性数据处理。推荐 OpenAI Agents SDK。理由:轻量、贴近 OpenAI 模型和工具生态,不需要复杂状态管理。

多分支/需要暂停恢复:例如客服审批流程、多步骤业务 workflow、长期运行的研究 Agent。继续第二步。

第二步:判断工具生态和状态需求

问题:你的 Agent 主要依赖 OpenAI 工具生态,还是需要显式状态图?

OpenAI 工具生态优先:例如主要用 OpenAI Hosted tools、MCP servers、OpenAI 模型。推荐 OpenAI Agents SDK。注意:如果需要复杂审批流、状态回放,考虑 LangGraph 或 Temporal + Agents SDK 组合。

需要显式状态图:例如复杂分支、可恢复、需要暂停审批和状态回放。推荐 LangGraph。注意:工程复杂度更高,需要设计和维护状态图。

第三步:判断生产治理需求

问题:你的 Agent 是研究原型,还是需要生产治理?

研究原型:例如多 agent 对话/协作研究、团队熟悉 AutoGen/CrewAI 生态。推荐 AutoGen、CrewAI。注意:状态持久化、失败恢复、观测、权限、部署需单独评估。

生产治理:例如强 SLA 业务流程、必须保证失败后重试、回滚、可追溯。推荐 LangGraph + Temporal 组合。组合方式:Temporal 管外层可靠业务流程,LangGraph 管 Agent 状态图和 LLM 调度。

决策终点

无论选择哪个框架,上线前都需要补充以下能力:

能力检查清单
状态持久化是否有 checkpoint/thread?是否可 resume/replay?
HITL 审批是否有 interrupt/Command resume?审批流是否完整?
观测性tracing 是否接入团队日志/指标/告警?
成本预算是否有预算上限、成本追踪、告警?
权限模型是否有权限隔离、审计日志、合规审批?
Eval dataset是否有回归测试、eval dataset、指标定义?
失败恢复是否有重试逻辑、回滚方案、人工接管流程?

下一步:如果你选择 OpenAI Agents SDK,需自己接团队日志/指标/告警、成本预算、权限模型、eval dataset 和失败恢复。如果你选择 LangGraph,需设计状态图、选择 persistence 后端、接团队日志/指标/告警、成本预算、权限模型、eval dataset。如果你选择 Temporal + Agent 框架组合,需定义 workflow/activity、配置 retry/timeout、接观测性、成本预算、权限模型。

下一步与延伸阅读

如果你已经确定框架选择,下一步可以按工程维度深入:

站内已有文章:AI Agent 开发实战:架构设计与实现指南 适合补 Agent 架构基础,包括组件划分、工具调用、状态设计。LangGraph 状态管理实战 解释 LangGraph 的 checkpoint、thread、resume/replay 机制。LangGraph vs AutoGen 状态追踪对比 对比 LangGraph 和 AutoGen 的状态追踪。AI Agent 监控告警与失败恢复 延伸到日志、告警、失败恢复和人工接管。Agent 记忆系统设计 可继续看短期/长期记忆与上下文管理。

后续专题会继续拆上下文工程、HITL 审批流、成本预算与控制、权限模型、状态机设计、eval dataset 与回归测试,以及从 demo 到生产的完整上线清单。

如果你还在选型阶段,建议先走一遍场景决策树,判断任务复杂度、工具生态和状态需求,再确定框架。不要只看 demo 能跑多快,上线前先检查状态持久化、HITL 审批、观测性、成本预算、权限模型、eval dataset 和失败恢复这七个维度。

AI Agent 工程化选型步骤

从 demo 跑通后进入生产选型时,用工程维度判断主框架、外层 workflow engine 和治理补齐项。

⏱️ 预计耗时: 30 分钟

  1. 1

    步骤 1: 判断任务是短会话还是长 workflow

    先看任务是否只需要一次性问答、检索和总结,还是会跨多步、多人审批、长时间等待和恢复执行。
  2. 2

    步骤 2: 列出生产治理要求

    把状态、审批、工具权限、失败恢复、成本预算、trace/audit 和 eval dataset 写成显式清单。
  3. 3

    步骤 3: 映射各框架的责任边界

    用 OpenAI Agents SDK、LangGraph、AutoGen/CrewAI、Temporal 分别映射轻量 Agent 原语、状态图、多角色协作和可靠 workflow。
  4. 4

    步骤 4: 用真实任务做试运行

    拿一条真实业务任务验证 trace、失败重试、人工接管、权限隔离和回归测试,而不是只跑 hello world demo。
  5. 5

    步骤 5: 决定主框架和补齐系统

    最后再决定主 Agent 框架、外层 workflow engine、观测系统、成本预算和权限模型由谁负责。

常见问题

LangGraph 和 OpenAI Agents SDK 是替代关系吗?
不完全是。OpenAI Agents SDK 更偏轻量 Agent 原语、工具调用、多 Agent handoff、guardrails、tracing、sessions 和 HITL;LangGraph 更偏显式状态图、持久化、暂停恢复和可回放 workflow。真实项目里可能组合使用。
做生产 Agent 一定要上 LangGraph 吗?
不一定。短任务、少状态、主要依赖 OpenAI 工具生态时,Agents SDK 更轻;多分支、可恢复、需要暂停审批和状态回放时,LangGraph 更合适。
AutoGen、CrewAI 还值得看吗?
如果重点是多角色协作、研究原型或团队熟悉该生态,可以看。但要单独评估状态持久化、失败恢复、观测、权限、成本和部署边界。
Temporal 和 LangGraph 怎么分工?
Temporal 是可靠业务 workflow 和 durable execution 基础设施;LangGraph 是 Agent 状态图和 LLM 调度。需要强 SLA 的业务流程可以让 Temporal 管外层 workflow、activity、retry 和 timeout,Agent 框架管智能步骤。
AI Agent 框架选型最容易漏掉什么?
最容易漏掉 HITL 审批、失败重试、trace/audit、成本预算、权限模型、eval dataset 和回滚方案。这些通常不是 demo 阶段会自然暴露的问题。

13 分钟阅读 · 发布于: 2026年9月11日 · 修改于: 2026年9月11日

评论

使用 GitHub 账号登录后即可评论

Easton BlogEaston Blog