Browser Agent 是什么?AI 为什么开始自己操作浏览器

"OpenAI Computer Use:模型通过截图感知页面,返回 UI 动作,由宿主执行,并强调隔离与安全边界。"
让 AI 去 GitHub release 页、官网文档、定价页来回点开,最后给我一份带链接的对比表。
这不是爬虫能干的。爬虫只抓静态页面,不会操作;RPA 录制回放桌面流程,不感知页面语义,遇到动态 UI 就挂;传统 Playwright 脚本也有类似问题:代码写死了 .submit-btn,前端改了个 aria label,脚本就全挂。
Browser Agent 的差别在于:AI 模型看页面截图或结构化数据,理解“这里有个按钮”,决定“我要点它”,然后浏览器执行动作,再观察新状态。
概念边界、技术路线、适用场景和合规边界,先在这里讲清楚。Browser Use、Playwright MCP、Stagehand、云基础设施和安全合规,会分别放在后续专题里。
Browser Agent 是什么?
工作定义
Browser Agent 这个词不是行业标准名,各家产品叫法不同:Computer Use、Browser Automation Agent、AI Web Agent。
BetterLink 本系列的工作定义是:Browser Agent = 模型决策 + 浏览器工具 + 运行时。
核心是 AI 模型接收页面状态(截图或结构化数据),返回 UI 动作(点击/输入/滚动),由宿主代码执行,再观察新状态。
核心循环
Browser Agent 的工作循环是:
目标(用户给自然语言任务)
↓
观察(截图或 accessibility snapshot)
↓
决策(模型返回 UI 动作:点击/输入/滚动)
↓
执行(宿主代码在浏览器执行动作)
↓
新状态(页面变化,重新观察)
对比传统脚本:传统脚本写死选择器,比如 .submit-btn。前端改了个 aria label 或 class,脚本就挂。AI 根据页面语义重新找目标,selector 变化后仍能继续。
与相近概念的区别
-
不是爬虫:爬虫只抓取静态页面,不操作。遇到动态内容、前端渲染页面,爬虫抓不到。
-
不是 RPA:RPA 录制回放桌面流程,不感知页面语义,遇到动态 UI 易挂。
-
不是纯 Playwright 脚本:代码确定性高,但维护成本高,改一个 class 就挂。
-
Computer Use 是更大范畴:桌面级操作,Browser Agent 是其在浏览器场景的子集。站内有单独文章讲 Computer Use 的桌面应用:Computer-Use Agent:让 AI 操作你的电脑。
Browser Agent 与传统工具对照表
站内已有 OpenClaw、Computer Use、MCP 插件、爬虫相关内容,读者容易混淆边界。
用一张表把 Browser Agent 与爬虫、RPA、Selenium/Playwright 脚本、Computer Use 的区别一次讲清楚。
| 类型 | 核心特点 | 是否感知语义 | 维护成本 | 适用场景 | 典型工具 |
|---|---|---|---|---|---|
| 爬虫 | 只抓取静态页面,不操作 | ❌ 不感知 | 中(selector 脆弱) | 静态页面数据抓取 | Scrapy、Puppeteer、Cheerio |
| RPA | 录制回放桌面流程 | ❌ 不感知页面语义 | 低(录制即可),但动态 UI 易挂 | 桌面自动化、固定流程 | UiPath、Automation Anywhere |
| Selenium/Playwright 脚本 | 代码确定性高 | ❌ 不感知语义 | 高(改一个 class 就挂) | 前端测试、固定流程自动化 | Selenium、Playwright、Cypress |
| Computer Use | 桌面级操作 | ✅ 模型感知 UI | 中(模型适应性) | 桌面应用自动化、跨应用流程 | Claude Computer Use、OpenAI Computer Use |
| Browser Agent | 浏览器级操作,模型决策 | ✅ 模型理解页面语义 | 中低(selector 叱化后可重找) | 跨站点调研、无 API 后台、动态页面 | Browser Use、Stagehand、Playwright MCP |
解释段落
-
爬虫:只抓取静态页面,不操作。selector 脆弱,前端改个 class,爬虫规则就失效。
-
RPA:录制回放桌面流程,不感知页面语义。遇到动态 UI 易挂,适合固定流程。
-
Selenium/Playwright 脚本:代码确定性高,但维护成本高。改一个 class 或 aria label,脚本就挂。适合前端测试、固定流程自动化。
-
Computer Use:更大范畴,桌面级操作。Browser Agent 是其浏览器场景的子集。站内有单独文章:Computer-Use Agent:让 AI 操作你的电脑。
-
Browser Agent:模型用自然语言理解页面,selector 变化后仍能重新找目标。但需要运行时、状态验证、安全审批。适合跨站点调研、无 API 后台表单、动态页面操作。
站内关联
- OpenClaw 的浏览器自动化命令:让AI替你看文档:OpenClaw浏览器自动化实战指南,聚焦具体命令和安全用法。
- Computer Use 的桌面级应用:Computer-Use Agent:让 AI 操作你的电脑,覆盖桌面级 Computer Use 与 RPA 区别。
- MCP 插件的浏览器工具段落:MCP 插件完全指南:让 AI 接管你的工具链,包含 Playwright 浏览器自动化 MCP 段落。
为什么需要浏览器操作?
开发者常问:为什么不直接调用 API?
有官方 API 时,优先用 API。API 稳定、可审计、有权限控制。
无 API 或 API 不完整时,Browser Agent 可以补位。
判断表
| 场景 | 优先用 API | 优先用 Browser Agent |
|---|---|---|
| 有官方 API 且完整 | ✅ 稳定、可审计、有权限控制 | ❌ 不必要 |
| 无 API 或 API 不完整 | ❌ 无法调用 | ✅ 补位(后台系统、跨平台整合、内部工具) |
| 需要人工体验流程 | ❌ API 只返回数据 | ✅ 端到端测试、表单提交、UI 验证 |
| 需要登录态操作 | ❌ API 需要复杂认证 | ✅ 可复用 session(但有安全边界,见后续章节) |
| 大规模并发抓取 | ✅ API 更高效 | ❌ 浏览器成本高 |
| 涉及敏感账号/支付/权限 | ✅ API 有权限控制 | ❌ 需要严格审批(见安全边界章节) |
典型场景清单
-
跨站点调研对比:让 AI 去 GitHub release、官网文档、定价页来回点开,最后输出带链接的对比表。
-
无 API 后台表单提交:内部系统、遗留系统、跨平台整合,没有官方 API,只能通过网页操作。
-
端到端前端测试:验证真实交互,不只是静态快照。
-
需要登录态的操作:后台管理、数据导入导出(但有安全边界,见后续章节)。
-
动态内容抓取:前端渲染的页面,爬虫抓不到。
具体场景示例
一个按钮从 .submit-btn 改成 aria label 后,传统 Playwright 脚本挂了,AI 浏览器 agent 还能根据页面语义重新找目标。
后台表单提交前卡在 MFA/验证码,agent 必须停下来等人接手,而不是硬冲。
Browser Agent 的五条技术路线
读者听到 Browser Use、Stagehand、Playwright MCP、Browserbase 等工具,不知道它们解决哪一层。
用路线图表格把五大路线分层铺开。
| 路线 | 核心特点 | 代表工具/平台 | 适用场景 |
|---|---|---|---|
| 模型能力路线 | 截图感知 → 返回动作 → 宿主执行 | OpenAI Computer Use、Gemini Computer Use、Claude Computer Use | 桌面级自动化、跨应用流程 |
| MCP 工具路线 | 通过 Model Context Protocol 暴露浏览器能力,使用 accessibility snapshot(结构化) | Playwright MCP | MCP client(VS Code、Cursor、Claude Code)中调用浏览器 |
| 自主 Agent 路线 | 完整 autonomous browser agent,可本地或云端运行 | Browser Use | 需要 autonomous agent、云端托管、大规模运行 |
| 代码+AI 混合路线 | 脚本给精确性,agent 给灵活性 | Stagehand | 需要工程化可控、既要有确定性又要有适应性 |
| 云基础设施路线 | Browser-as-a-Service,提供运行时、会话、观测 | Browserbase、Cloudflare Browser Run | 需要托管浏览器、会话管理、观测能力 |
模型能力路线(Computer Use)
OpenAI、Gemini、Anthropic 都提供 Computer Use 能力。
核心机制:模型看截图,返回 UI 动作(点击/输入/滚动),由宿主代码执行,再观察新状态。
官方文档明确列出三种 harness:内置 computer tool、自定义 Playwright/Selenium/VNC/MCP harness、代码执行 harness。
Browser/VM 环境需要隔离。页面、工具输出、PDF、邮件、聊天等第三方内容要视为不可信输入。
本地原型可从 Playwright 或 Selenium 开始。更完整桌面环境可用 VM/container。
易变事实处理:模型版本、API 字段会变,正文只写机制和安全边界,具体版本请查阅官方站点。
MCP 工具路线(Playwright MCP)
Playwright MCP 通过 Model Context Protocol 给 LLM 暴露浏览器自动化能力。
它使用结构化 accessibility snapshot,而不是只靠截图。LLM 用元素 ref 点击、输入、选择。
支持 VS Code、Cursor、Windsurf、Claude Code、Claude Desktop、Codex 等 MCP client。
工具覆盖导航、点击、输入、截图、键鼠、tabs、dialogs、网络监控、mock、storage state。
安全警告:browser_run_code_unsafe 等直接执行代码能力相当于 RCE,只能给可信客户端。
本篇不写安装教程,后续会单独写 Playwright MCP 指南。
自主 Agent 路线(Browser Use)
Browser Use 定位为“The Way AI uses the web”,提供 Browser Harness、Hosted Web Agents、Custom Models、Cloud。
完整 autonomous browser agent,可本地或云端运行。
官网有 anti-detect / CAPTCHA / proxies 表述。正文不鼓励绕过验证码、反爬或平台规则。这些只作为后续安全合规专题的边界提醒。
易变事实:价格、benchmark、反检测能力、云能力,本篇不展开。
代码+AI 混合路线(Stagehand)
Stagehand 定位为 browser agents 的 SDK,用 AI 让浏览器 agent 更 resilient、readable、production-ready。
核心 primitives:act() 做动作、extract() 做结构化提取、observe() 观察可操作内容、agent() 跑多步自主流程。
官方强调“脚本给精确性,agent 给灵活性”:不是完全黑盒 agent,也不是纯 selector 脚本。
可本地运行,也可连接 Browserbase 的云浏览器。
本篇不写 API 教程,后续会单独写 Stagehand SDK 实践。
云基础设施路线(Browserbase + Cloudflare)
Browserbase 把浏览器作为 agent 可使用的基础设施,提供 Browsers、Search/Fetch APIs、Runtime、Identity、Models、Observability。
场景包括登录、动态内容、复杂交互、测试、研究、表单、数据移动。
Browserbase 和 Stagehand 形成“本地开发 + 云端运行/观测/身份”的组合。
Cloudflare Browser Run 运行 headless Chrome,用于 browser automation、web scraping、testing、content generation。
提供 Quick Actions 和 Browser Sessions 两类集成;支持 Puppeteer、Playwright、CDP、Stagehand。
官方用例表里直接列出 AI agent browsing:Playwright MCP 或 CDP with MCP clients。
支持 session reuse、edge 运行、Markdown/screenshot/PDF/snapshot/links/structured data/crawl 等输出。
说明 Browser Agent 工程栈不只是模型,还需要运行时、会话和可观测能力。
易变事实:定价、限额、产品命名,本篇不展开。
什么任务适合 Browser Agent?
用判断表帮助读者快速决策。
判断表
| 适合 | 不适合 |
|---|---|
| ✅ 跨站点调研对比 | ❌ 有稳定 API 的系统 |
| ✅ 无 API 后台表单提交 | ❌ 需要大规模并发抓取 |
| ✅ 端到端前端测试 | ❌ 涉及敏感账号/支付/权限(需要严格审批) |
| ✅ 需要登录态的操作(有安全边界) | ❌ 平台明确禁止自动化 |
| ✅ 动态内容抓取(前端渲染) | ❌ 高频重复任务(考虑 API 或脚本) |
可执行步骤块示例
适合 Browser Agent 的典型流程:
-
用户给出自然语言任务:“帮我对比 5 个 SaaS 产品的定价和功能”
-
Browser Agent 打开官网文档、定价页、功能页
-
Agent 截图或读取 accessibility snapshot
-
模型理解页面内容,决定下一步动作(点击、滚动、输入)
-
遇到验证码或 MFA,停下来等人接手
-
最终输出结构化对比表
具体场景示例
一个按钮从 .submit-btn 改成 aria label 后,传统 Playwright 脚本挂了,AI 浏览器 agent 还能根据页面语义重新找目标。
后台表单提交前卡在 MFA/验证码,agent 必须停下来等人接手,而不是硬冲。
安全边界与合规
Computer Use/Browser Agent 涉及敏感操作、prompt injection、账号权限。
明确安全边界,不鼓励绕过平台规则。
安全清单
| 风险 | 处理方式 |
|---|---|
| 网页内容不可信(prompt injection) | 将页面、工具输出、PDF、邮件、聊天当作不可信输入,可能影响模型行为 |
| 联网时风险更高 | 使用低权限 VM/container、域名 allowlist、限制敏感数据 |
| 高影响操作(登录、支付、提交) | 必须人工确认(human-in-the-loop) |
| 不能鼓励自动登录、绕过验证码 | 正文不写绕过方法,只作为边界提醒 |
| 审计日志 | 记录所有动作,可追溯 |
| 最小权限 | 只给必要的权限,不使用 root/admin 账号 |
| 隔离环境 | 使用 Docker/VM,不直接在主机运行 |
风险段落
网页内容(页面、工具输出、PDF、邮件、聊天)都是不可信输入,可能影响模型行为(prompt injection)。
联网时风险更高。需用低权限 VM/container、域名 allowlist、限制敏感数据。
高影响操作(登录、支付、提交)必须人工确认(human-in-the-loop)。
不能鼓励自动登录、绕过验证码、绕过平台规则。
审计日志、最小权限、隔离环境是必须的。
Anthropic Computer Use 文档特别提到:网页或图片里的指令可能影响模型行为,属于 prompt injection 风险。需要隔离和确认机制。
后续学习路径
本篇是系列入口页,不替代后续单篇。
已发布的站内相关文章
-
让AI替你看文档:OpenClaw浏览器自动化实战指南:聚焦 OpenClaw Browser Skills 的具体命令和安全用法。
-
Computer-Use Agent:让 AI 操作你的电脑:桌面级 Computer Use 与 RPA 区别。
-
MCP 插件完全指南:让 AI 接管你的工具链:MCP 插件指南,包含 Playwright 浏览器自动化 MCP 段落。
本系列后续专题
后续会单独写以下专题:
-
Browser Use 实战:完整 autonomous browser agent,本地或云端运行。
-
Playwright MCP 指南:通过 MCP 暴露浏览器能力,结构化 accessibility snapshot。
-
Stagehand SDK 实践:代码确定性 + AI 适应性,工程化路线。
-
工具对比与选型:Browser Use vs Stagehand vs Playwright MCP vs Computer Use。
-
网页抓取实战:动态内容抓取、前端渲染页面。
-
调研对比实战:跨站点数据对比、表格生成。
-
表单提交实战:无 API 后台表单、跨平台整合。
-
登录态操作:session 管理、后台管理、数据导入导出(有安全边界)。
-
重试与稳定性:selector 变化、动态 UI、错误处理。
-
前端测试实战:端到端测试、UI 验证。
-
Codex 验证:Codex 场景下的 Computer Use / 内置浏览器。
-
飞书看板自动化:飞书后台表单、数据移动。
-
云基础设施选型:Browserbase、Cloudflare Browser Run、托管浏览器。
-
合规边界:平台规则、反爬、验证码处理。
-
安全实践:prompt injection、隔离环境、审计日志。
-
AgentScout:开源工具实践。
推荐下一步
如果你想快速上手,可以先看 OpenClaw 浏览器自动化实战或 Computer-Use Agent。
如果你想深入了解某条技术路线,后续会单独写 Playwright MCP、Stagehand、Browser Use 等专题。
最小 Browser Agent 设计步骤
限定任务、配置浏览器环境、观察页面、执行动作、验证状态,并在高风险动作前让人接手。
- 1
步骤 1: 限定任务
先写清楚目标、允许访问的网站、禁止动作和最终输出格式。 - 2
步骤 2: 配置环境
使用独立浏览器配置、单独账号和低权限运行环境。 - 3
步骤 3: 观察页面
通过截图、DOM 或 accessibility snapshot 读取当前状态。 - 4
步骤 4: 执行动作
让模型决定点击、输入、滚动等 UI 动作,再由宿主代码执行。 - 5
步骤 5: 验证结果
检查页面是否真的完成了任务,必要时重试或换路径。 - 6
步骤 6: 人工确认
登录、付款、提交表单、删除数据等高风险动作前必须停下来确认。
常见问题
Browser Agent 是不是就是爬虫?
Browser Agent 和 RPA 有什么区别?
为什么不直接用 API?
能不能自动登录、填表、提交?
验证码怎么办?
网页里的 prompt injection 会不会让 agent 被骗?
13 分钟阅读 · 发布于: 2026年9月4日 · 修改于: 2026年9月4日



评论
使用 GitHub 账号登录后即可评论