2026 AI Agent 工程化全景:从 LangGraph 到 OpenAI Agents SDK 怎么选

"OpenAI Agents SDK Documentation"
客服调研 Agent demo 已经能查文档、总结结果、发飞书消息。但准备上线时,团队才发现还缺排队、审批、失败恢复、日志、成本上限和回归测试。产品经理问“能不能下周给运营团队用”,开发者意识到:选 LangGraph 还是 OpenAI Agents SDK,不是看 demo 能跑多快,而是看状态持久化、人工审批、观测性、成本预算、权限模型、eval dataset 和失败恢复这七个工程维度。
OpenAI Agents SDK:轻量优先的选择
OpenAI Agents SDK 是轻量、代码优先的 Agent 构建工具,贴近 OpenAI 模型与工具调用生态。
核心原语包括:
| 原语 | 说明 | 边界 |
|---|---|---|
| Agents | instructions、model、tools、MCP servers、handoffs、guardrails 的组合单元 | 不是显式状态图,每次运行的业务状态仍要自己设计 |
| Handoffs | 多 Agent 交接机制,一个 Agent 可将任务 handoff 给另一个 | 不等于长期运行 workflow 控制 |
| Guardrails | input/output guardrails,并行检查,触发 tripwire 后抛异常 | 不等于完整权限模型、审计日志或合规审批流 |
| Tracing | 内置 traces/spans,支持自定义 processor、敏感数据控制 | 不等于完整监控、告警、成本预算或回滚系统 |
| Tools | 支持 OpenAI Hosted tools、自定义函数工具、MCP servers | 具体工具类型和 MCP 支持需回查官方文档 |
| Sessions / HITL | 官方文档已有 sessions、human-in-the-loop 和 sandbox agents 等能力入口 | 不等于 LangGraph 式 graph checkpoint、time travel 和 replay |
如果你需要快速构建一个轻量代码型 Agent,主要依赖 OpenAI 模型和工具调用生态,需要多 Agent handoff、结果前后加护栏、SDK 内置 tracing 和较低的框架复杂度,OpenAI Agents SDK 是较轻的选择。例如:客服问答、文档检索 + 总结、多 Agent 依次处理。
代价与边界:Guardrails 可以做输入输出校验,但复杂审批流、权限隔离、审计日志仍需业务层自己实现。Tracing 能接入 OpenTelemetry 或自定义 processor,但团队的日志、指标、告警、成本预算、回归测试需自己接。Sessions 和 HITL 能补一部分会话与人工介入能力,但如果你需要显式状态图、checkpoint、resume/replay、time travel 或长期 workflow 控制,仍要评估 LangGraph、Temporal 或业务层状态系统。
不适合的场景:复杂状态分支,需要暂停恢复、人工审批后继续执行;强 SLA 业务流程,必须保证失败后重试、回滚、可追溯;需要状态回放、时间旅行、长期运行 workflow 控制。
易变事实提醒:OpenAI Agents SDK 的 API、默认模型、Hosted tools、MCP 支持、sessions、sandbox agents、tracing 默认行为和价格都可能变化。集成前应回查 OpenAI Agents SDK 官方文档。
LangGraph:显式状态与持久化的强项
LangGraph 是 low-level orchestration framework,用于 stateful agents,强调 durable execution、HITL、memory、time travel。
核心能力:
| 能力 | 说明 | 典型用途 |
|---|---|---|
| Durable execution | 通过 checkpointer 持久化 thread、checkpoint/state snapshots | 失败后可从 checkpoint resume 或 replay |
| Human-in-the-loop | interrupt 暂停执行,Command resume 恢复,可 approve/reject/edit/review tool calls | 复杂审批流、人工确认敏感操作 |
| Memory | comprehensive memory,可保存短期/长期上下文 | Agent 记忆系统设计 |
| Time travel | 可从历史 checkpoint replay 或 fork | 回放失败执行、对比不同分支结果 |
持久化机制
LangGraph 的持久化不是简单聊天历史,而是围绕 thread 和 checkpoint:
Thread:一次对话或 workflow 的执行线程。Checkpoint:某个时刻的完整状态快照,包括 graph state、pending tasks、pending writes。Resume/Replay:从某个 checkpoint 恢复执行,或回放历史执行路径。
这种机制适合需要暂停恢复、失败重试、状态回放的场景。例如:客服审批流程、多步骤业务 workflow、长期运行的研究 Agent。
Human-in-the-loop(HITL)
LangGraph 的 HITL 更贴近有状态 workflow 暂停/恢复:
Interrupt:在某个节点暂停执行,等待人工输入。Command resume:人工 approve/reject/edit 后,用 Command 对象恢复执行。Tool call review:可在执行某个 tool call 前暂停,让人工审批。
对比 OpenAI Agents SDK 的 guardrails:Guardrails 更偏运行前后校验,LangGraph HITL 更偏 workflow 中间暂停/恢复。如果你的审批流需要多轮对话、状态保存、回放和分支,LangGraph 更合适。
如果你需要复杂状态分支、可恢复、需要暂停审批和状态回放,LangGraph 是更贴近生产的选择。例如:客服审批流程、多步骤业务 workflow、长期运行的研究 Agent。
代价:工程复杂度更高,需要设计和维护状态图。需要选择 persistence 后端,后端支持范围可能变化,集成前应核验官方文档。
不适合的场景:短任务、少状态、快速原型。主要依赖 OpenAI 工具生态,不需要持久化或复杂审批。
易变事实提醒:LangGraph v1、Platform/Studio/Deployment、persistence 后端支持可能变化。集成前应回查 LangGraph 官方文档。
关于 LangGraph 状态管理的详细机制,见站内文章:LangGraph 状态管理实战 和 LangGraph vs AutoGen 状态追踪对比。
AutoGen、CrewAI、Temporal:多 agent 与 durable execution 的补充
选型不是只有 OpenAI Agents SDK 和 LangGraph 二选一。如果你的重点是多角色协作、研究原型或需要独立的工作流基础设施,还需要看 AutoGen、CrewAI 和 Temporal。
AutoGen / AG2
AutoGen 是 layered framework,包含 Core API、AgentChat API、Extensions 和 Studio,面向多 agent 对话和协作应用。
核心能力:Core API 是底层 agent runtime 和消息路由,AgentChat API 是高层对话和协作抽象,Extensions 是与外部工具、模型、平台的集成层,Studio 是可视化构建和调试工具。
适用场景:多 agent 对话/协作研究和原型;团队已经熟悉 AutoGen 生态。
需要单独评估:状态持久化、失败恢复、观测、权限和部署。AutoGen 与 AG2 的版本关系、API 稳定性、文档入口。集成前应核验 AutoGen 官方文档。
易变事实提醒:AutoGen 与 AG2 的版本迁移、与 Microsoft Agent Framework 的关系、API 稳定性都可能变化。本文只把它作为多 agent 协作候选,不把版本路线写成强结论。
CrewAI
CrewAI 以 crews、agents、tasks、processes、flows 等概念组织多 agent 协作,并提供 Flows 等结构化能力。
核心概念:Crews 是一组 agents 和 tasks 的组合,Agents 是角色定义,Tasks 是具体任务,Processes 是任务执行流程,Flows 是更结构化的多步骤编排。
适用场景:角色协作型 Agent 应用;快速编排和原型。
需要单独评估:产品模块、托管能力、pricing、enterprise 特性。集成前应核验 CrewAI 官方文档。
易变事实提醒:CrewAI 的产品模块、托管能力、pricing、enterprise 特性可能变化。本文不评价它“是否最强”,只放入多 agent 协作候选维度。
Temporal
Temporal 不是 Agent 框架,是 durable execution infrastructure。它提供 workflow、activity、retry、timeout、visibility 等能力,适合承载“必须可靠执行”的业务流程。
核心能力:Workflow 是长期运行流程的定义,Activity 是可能失败的外部操作封装,Retry/Timeout 是可配置的重试策略和超时控制,Visibility 是 workflow 执行状态的查询和监控。
与 Agent 框架的关系:Agent 可以作为 Temporal workflow 或 activity 中的一步。Temporal 管外层可靠业务流程,Agent 框架管智能步骤。
适用场景:强 SLA 业务流程,必须保证失败后重试、回滚、可追溯;复杂企业流程,需要队列、重试、超时、审计。
不等于:不是把所有逻辑塞进 Agent 框架。Temporal + Agent SDK/LangGraph 可能是更合理的组合。
易变事实提醒:Temporal Cloud pricing、SDK API、部署方式可能变化。集成前应核验 Temporal 官方文档。
选型维度矩阵:一眼看明各框架在生产维度的差异
选型不是看热度榜,而是看七个工程维度:状态持久化、HITL 审批、观测性、成本预算、权限模型、eval dataset、失败恢复。以下表格对比五个框架在这些维度的能力和边界。
| 框架 | 状态持久化 | HITL 审批 | 观测性 | 成本预算 | 权限模型 | Eval dataset | 失败恢复 |
|---|---|---|---|---|---|---|---|
| OpenAI Agents SDK | Sessions 可维护会话上下文,但不是 graph checkpoint/time travel | 有 HITL/guardrails 能力入口,复杂审批流仍需业务层设计 | 内置 tracing,需要自己接日志/指标/告警 | 无完整内置预算系统,需自己接 | Guardrails 不等于完整权限模型、审计日志或合规审批 | 需自己实现 | 普通重试、恢复和回滚仍需业务层设计 |
| LangGraph | Checkpointer + thread + checkpoint/state snapshots,可 resume/replay | Interrupt + Command resume,可 approve/reject/edit/review tool calls | 可接入 OpenTelemetry,需自己接日志/指标/告警 | 无内置,需自己接 | 需在 graph 节点或业务层实现 | 需自己实现 | 从 checkpoint resume 或 replay,支持重试和回放 |
| AutoGen | 需单独评估状态持久化能力 | 需单独评估 HITL 能力 | 需单独评估观测性集成 | 需单独评估 | 需单独评估 | 需单独评估 | 需单独评估 |
| CrewAI | 需单独评估状态持久化能力 | 需单独评估 HITL 能力 | 需单独评估观测性集成 | 需单独评估 | 需单独评估 | 需单独评估 | 需单独评估 |
| Temporal | Workflow + activity,支持长期 workflow 状态 | Workflow 可暂停等待人工输入,审批流可在 workflow 层实现 | 内置 visibility,可接入 OpenTelemetry | 可在 workflow/activity 层实现预算控制 | Workflow/activity 层可实现权限检查 | 需自己实现 | 内置 retry/timeout,适合可靠执行和恢复 |
关键判断:状态持久化、HITL 审批、失败恢复方面,LangGraph 和 Temporal 更强;OpenAI Agents SDK 更轻,但复杂生产治理仍要自己接。观测性方面,所有框架都需要自己接团队的日志、指标、告警;OpenAI Agents SDK 和 LangGraph 有 tracing 抽象,Temporal 有 visibility 抽象。成本预算、权限模型、eval dataset 方面,所有框架都需要自己实现;不要默认某个 Agent 框架已经替你解决。AutoGen、CrewAI 适合多角色协作和原型,但生产维度需单独评估。
不等于:Tracing 不等于完整可观测性。Guardrails 不等于完整权限模型、审计日志或合规审批流。Checkpoint/thread 不等于不需要队列、数据库或工作流引擎。
场景决策树:从 demo 跑通后到上线的路径
如果你的 Agent demo 已经能跑,准备上线前先走一遍这个决策流程。
第一步:判断任务复杂度
问题:你的 Agent 是短任务/少状态,还是多分支/需要暂停恢复?
短任务/少状态:例如单次问答、文档检索 + 总结、一次性数据处理。推荐 OpenAI Agents SDK。理由:轻量、贴近 OpenAI 模型和工具生态,不需要复杂状态管理。
多分支/需要暂停恢复:例如客服审批流程、多步骤业务 workflow、长期运行的研究 Agent。继续第二步。
第二步:判断工具生态和状态需求
问题:你的 Agent 主要依赖 OpenAI 工具生态,还是需要显式状态图?
OpenAI 工具生态优先:例如主要用 OpenAI Hosted tools、MCP servers、OpenAI 模型。推荐 OpenAI Agents SDK。注意:如果需要复杂审批流、状态回放,考虑 LangGraph 或 Temporal + Agents SDK 组合。
需要显式状态图:例如复杂分支、可恢复、需要暂停审批和状态回放。推荐 LangGraph。注意:工程复杂度更高,需要设计和维护状态图。
第三步:判断生产治理需求
问题:你的 Agent 是研究原型,还是需要生产治理?
研究原型:例如多 agent 对话/协作研究、团队熟悉 AutoGen/CrewAI 生态。推荐 AutoGen、CrewAI。注意:状态持久化、失败恢复、观测、权限、部署需单独评估。
生产治理:例如强 SLA 业务流程、必须保证失败后重试、回滚、可追溯。推荐 LangGraph + Temporal 组合。组合方式:Temporal 管外层可靠业务流程,LangGraph 管 Agent 状态图和 LLM 调度。
决策终点
无论选择哪个框架,上线前都需要补充以下能力:
| 能力 | 检查清单 |
|---|---|
| 状态持久化 | 是否有 checkpoint/thread?是否可 resume/replay? |
| HITL 审批 | 是否有 interrupt/Command resume?审批流是否完整? |
| 观测性 | tracing 是否接入团队日志/指标/告警? |
| 成本预算 | 是否有预算上限、成本追踪、告警? |
| 权限模型 | 是否有权限隔离、审计日志、合规审批? |
| Eval dataset | 是否有回归测试、eval dataset、指标定义? |
| 失败恢复 | 是否有重试逻辑、回滚方案、人工接管流程? |
下一步:如果你选择 OpenAI Agents SDK,需自己接团队日志/指标/告警、成本预算、权限模型、eval dataset 和失败恢复。如果你选择 LangGraph,需设计状态图、选择 persistence 后端、接团队日志/指标/告警、成本预算、权限模型、eval dataset。如果你选择 Temporal + Agent 框架组合,需定义 workflow/activity、配置 retry/timeout、接观测性、成本预算、权限模型。
下一步与延伸阅读
如果你已经确定框架选择,下一步可以按工程维度深入:
站内已有文章:AI Agent 开发实战:架构设计与实现指南 适合补 Agent 架构基础,包括组件划分、工具调用、状态设计。LangGraph 状态管理实战 解释 LangGraph 的 checkpoint、thread、resume/replay 机制。LangGraph vs AutoGen 状态追踪对比 对比 LangGraph 和 AutoGen 的状态追踪。AI Agent 监控告警与失败恢复 延伸到日志、告警、失败恢复和人工接管。Agent 记忆系统设计 可继续看短期/长期记忆与上下文管理。
后续专题会继续拆上下文工程、HITL 审批流、成本预算与控制、权限模型、状态机设计、eval dataset 与回归测试,以及从 demo 到生产的完整上线清单。
如果你还在选型阶段,建议先走一遍场景决策树,判断任务复杂度、工具生态和状态需求,再确定框架。不要只看 demo 能跑多快,上线前先检查状态持久化、HITL 审批、观测性、成本预算、权限模型、eval dataset 和失败恢复这七个维度。
AI Agent 工程化选型步骤
从 demo 跑通后进入生产选型时,用工程维度判断主框架、外层 workflow engine 和治理补齐项。
⏱️ 预计耗时: 30 分钟
- 1
步骤 1: 判断任务是短会话还是长 workflow
先看任务是否只需要一次性问答、检索和总结,还是会跨多步、多人审批、长时间等待和恢复执行。 - 2
步骤 2: 列出生产治理要求
把状态、审批、工具权限、失败恢复、成本预算、trace/audit 和 eval dataset 写成显式清单。 - 3
步骤 3: 映射各框架的责任边界
用 OpenAI Agents SDK、LangGraph、AutoGen/CrewAI、Temporal 分别映射轻量 Agent 原语、状态图、多角色协作和可靠 workflow。 - 4
步骤 4: 用真实任务做试运行
拿一条真实业务任务验证 trace、失败重试、人工接管、权限隔离和回归测试,而不是只跑 hello world demo。 - 5
步骤 5: 决定主框架和补齐系统
最后再决定主 Agent 框架、外层 workflow engine、观测系统、成本预算和权限模型由谁负责。
常见问题
LangGraph 和 OpenAI Agents SDK 是替代关系吗?
做生产 Agent 一定要上 LangGraph 吗?
AutoGen、CrewAI 还值得看吗?
Temporal 和 LangGraph 怎么分工?
AI Agent 框架选型最容易漏掉什么?
13 分钟阅读 · 发布于: 2026年9月11日 · 修改于: 2026年9月11日
AI Agent 工程化专题:架构、工具调用、评估与恢复
如果你是从搜索进入这篇文章,建议顺手补上上一篇或继续下一篇,这样更容易把同一主题读完整。
上一篇
DeepAgents 架构解析:规划工具、子代理与文件系统
深度解析 DeepAgents 四大支柱架构:Planning Tools、Sub-agents、File System 和 System Prompts,对比 LangGraph、AutoGen 等框架,提供实战代码示例和最佳实践
第 16 / 22 篇
下一篇
Agent 上下文工程实战:System Prompt、Memory、Tools 和 Files 怎么分层
把 Agent 上下文拆成 system prompt、developer rules、memory、files、retrieval、tool schema、runtime state 和 output contract,给你一套避免上下文膨胀和规则失效的工程分层方法。
第 18 / 22 篇



评论
使用 GitHub 账号登录后即可评论