切换主题

Browser Agent 是什么?AI 为什么开始自己操作浏览器

Easton editorial illustration: one browser window controlled by a central agent pointer

"OpenAI Computer Use:模型通过截图感知页面,返回 UI 动作,由宿主执行,并强调隔离与安全边界。"

让 AI 去 GitHub release 页、官网文档、定价页来回点开,最后给我一份带链接的对比表。

这不是爬虫能干的。爬虫只抓静态页面,不会操作;RPA 录制回放桌面流程,不感知页面语义,遇到动态 UI 就挂;传统 Playwright 脚本也有类似问题:代码写死了 .submit-btn,前端改了个 aria label,脚本就全挂。

Browser Agent 的差别在于:AI 模型看页面截图或结构化数据,理解“这里有个按钮”,决定“我要点它”,然后浏览器执行动作,再观察新状态。

概念边界、技术路线、适用场景和合规边界,先在这里讲清楚。Browser Use、Playwright MCP、Stagehand、云基础设施和安全合规,会分别放在后续专题里。

Browser Agent 是什么?

工作定义

Browser Agent 这个词不是行业标准名,各家产品叫法不同:Computer Use、Browser Automation Agent、AI Web Agent。

BetterLink 本系列的工作定义是:Browser Agent = 模型决策 + 浏览器工具 + 运行时。

核心是 AI 模型接收页面状态(截图或结构化数据),返回 UI 动作(点击/输入/滚动),由宿主代码执行,再观察新状态。

核心循环

Browser Agent 的工作循环是:

目标(用户给自然语言任务)

观察(截图或 accessibility snapshot)

决策(模型返回 UI 动作:点击/输入/滚动)

执行(宿主代码在浏览器执行动作)

新状态(页面变化,重新观察)

对比传统脚本:传统脚本写死选择器,比如 .submit-btn。前端改了个 aria label 或 class,脚本就挂。AI 根据页面语义重新找目标,selector 变化后仍能继续。

与相近概念的区别

  • 不是爬虫:爬虫只抓取静态页面,不操作。遇到动态内容、前端渲染页面,爬虫抓不到。

  • 不是 RPA:RPA 录制回放桌面流程,不感知页面语义,遇到动态 UI 易挂。

  • 不是纯 Playwright 脚本:代码确定性高,但维护成本高,改一个 class 就挂。

  • Computer Use 是更大范畴:桌面级操作,Browser Agent 是其在浏览器场景的子集。站内有单独文章讲 Computer Use 的桌面应用:Computer-Use Agent:让 AI 操作你的电脑

Browser Agent 与传统工具对照表

站内已有 OpenClaw、Computer Use、MCP 插件、爬虫相关内容,读者容易混淆边界。

用一张表把 Browser Agent 与爬虫、RPA、Selenium/Playwright 脚本、Computer Use 的区别一次讲清楚。

类型核心特点是否感知语义维护成本适用场景典型工具
爬虫只抓取静态页面,不操作❌ 不感知中(selector 脆弱)静态页面数据抓取Scrapy、Puppeteer、Cheerio
RPA录制回放桌面流程❌ 不感知页面语义低(录制即可),但动态 UI 易挂桌面自动化、固定流程UiPath、Automation Anywhere
Selenium/Playwright 脚本代码确定性高❌ 不感知语义高(改一个 class 就挂)前端测试、固定流程自动化Selenium、Playwright、Cypress
Computer Use桌面级操作✅ 模型感知 UI中(模型适应性)桌面应用自动化、跨应用流程Claude Computer Use、OpenAI Computer Use
Browser Agent浏览器级操作,模型决策✅ 模型理解页面语义中低(selector 叱化后可重找)跨站点调研、无 API 后台、动态页面Browser Use、Stagehand、Playwright MCP

解释段落

  • 爬虫:只抓取静态页面,不操作。selector 脆弱,前端改个 class,爬虫规则就失效。

  • RPA:录制回放桌面流程,不感知页面语义。遇到动态 UI 易挂,适合固定流程。

  • Selenium/Playwright 脚本:代码确定性高,但维护成本高。改一个 class 或 aria label,脚本就挂。适合前端测试、固定流程自动化。

  • Computer Use:更大范畴,桌面级操作。Browser Agent 是其浏览器场景的子集。站内有单独文章:Computer-Use Agent:让 AI 操作你的电脑

  • Browser Agent:模型用自然语言理解页面,selector 变化后仍能重新找目标。但需要运行时、状态验证、安全审批。适合跨站点调研、无 API 后台表单、动态页面操作。

站内关联

为什么需要浏览器操作?

开发者常问:为什么不直接调用 API?

有官方 API 时,优先用 API。API 稳定、可审计、有权限控制。

无 API 或 API 不完整时,Browser Agent 可以补位。

判断表

场景优先用 API优先用 Browser Agent
有官方 API 且完整✅ 稳定、可审计、有权限控制❌ 不必要
无 API 或 API 不完整❌ 无法调用✅ 补位(后台系统、跨平台整合、内部工具)
需要人工体验流程❌ API 只返回数据✅ 端到端测试、表单提交、UI 验证
需要登录态操作❌ API 需要复杂认证✅ 可复用 session(但有安全边界,见后续章节)
大规模并发抓取✅ API 更高效❌ 浏览器成本高
涉及敏感账号/支付/权限✅ API 有权限控制❌ 需要严格审批(见安全边界章节)

典型场景清单

  • 跨站点调研对比:让 AI 去 GitHub release、官网文档、定价页来回点开,最后输出带链接的对比表。

  • 无 API 后台表单提交:内部系统、遗留系统、跨平台整合,没有官方 API,只能通过网页操作。

  • 端到端前端测试:验证真实交互,不只是静态快照。

  • 需要登录态的操作:后台管理、数据导入导出(但有安全边界,见后续章节)。

  • 动态内容抓取:前端渲染的页面,爬虫抓不到。

具体场景示例

一个按钮从 .submit-btn 改成 aria label 后,传统 Playwright 脚本挂了,AI 浏览器 agent 还能根据页面语义重新找目标。

后台表单提交前卡在 MFA/验证码,agent 必须停下来等人接手,而不是硬冲。

Browser Agent 的五条技术路线

读者听到 Browser Use、Stagehand、Playwright MCP、Browserbase 等工具,不知道它们解决哪一层。

用路线图表格把五大路线分层铺开。

路线核心特点代表工具/平台适用场景
模型能力路线截图感知 → 返回动作 → 宿主执行OpenAI Computer Use、Gemini Computer Use、Claude Computer Use桌面级自动化、跨应用流程
MCP 工具路线通过 Model Context Protocol 暴露浏览器能力,使用 accessibility snapshot(结构化)Playwright MCPMCP client(VS Code、Cursor、Claude Code)中调用浏览器
自主 Agent 路线完整 autonomous browser agent,可本地或云端运行Browser Use需要 autonomous agent、云端托管、大规模运行
代码+AI 混合路线脚本给精确性,agent 给灵活性Stagehand需要工程化可控、既要有确定性又要有适应性
云基础设施路线Browser-as-a-Service,提供运行时、会话、观测Browserbase、Cloudflare Browser Run需要托管浏览器、会话管理、观测能力

模型能力路线(Computer Use)

OpenAI、Gemini、Anthropic 都提供 Computer Use 能力。

核心机制:模型看截图,返回 UI 动作(点击/输入/滚动),由宿主代码执行,再观察新状态。

官方文档明确列出三种 harness:内置 computer tool、自定义 Playwright/Selenium/VNC/MCP harness、代码执行 harness。

Browser/VM 环境需要隔离。页面、工具输出、PDF、邮件、聊天等第三方内容要视为不可信输入。

本地原型可从 Playwright 或 Selenium 开始。更完整桌面环境可用 VM/container。

易变事实处理:模型版本、API 字段会变,正文只写机制和安全边界,具体版本请查阅官方站点。

MCP 工具路线(Playwright MCP)

Playwright MCP 通过 Model Context Protocol 给 LLM 暴露浏览器自动化能力。

它使用结构化 accessibility snapshot,而不是只靠截图。LLM 用元素 ref 点击、输入、选择。

支持 VS Code、Cursor、Windsurf、Claude Code、Claude Desktop、Codex 等 MCP client。

工具覆盖导航、点击、输入、截图、键鼠、tabs、dialogs、网络监控、mock、storage state。

安全警告:browser_run_code_unsafe 等直接执行代码能力相当于 RCE,只能给可信客户端。

本篇不写安装教程,后续会单独写 Playwright MCP 指南。

自主 Agent 路线(Browser Use)

Browser Use 定位为“The Way AI uses the web”,提供 Browser Harness、Hosted Web Agents、Custom Models、Cloud。

完整 autonomous browser agent,可本地或云端运行。

官网有 anti-detect / CAPTCHA / proxies 表述。正文不鼓励绕过验证码、反爬或平台规则。这些只作为后续安全合规专题的边界提醒。

易变事实:价格、benchmark、反检测能力、云能力,本篇不展开。

代码+AI 混合路线(Stagehand)

Stagehand 定位为 browser agents 的 SDK,用 AI 让浏览器 agent 更 resilient、readable、production-ready。

核心 primitives:act() 做动作、extract() 做结构化提取、observe() 观察可操作内容、agent() 跑多步自主流程。

官方强调“脚本给精确性,agent 给灵活性”:不是完全黑盒 agent,也不是纯 selector 脚本。

可本地运行,也可连接 Browserbase 的云浏览器。

本篇不写 API 教程,后续会单独写 Stagehand SDK 实践。

云基础设施路线(Browserbase + Cloudflare)

Browserbase 把浏览器作为 agent 可使用的基础设施,提供 Browsers、Search/Fetch APIs、Runtime、Identity、Models、Observability。

场景包括登录、动态内容、复杂交互、测试、研究、表单、数据移动。

Browserbase 和 Stagehand 形成“本地开发 + 云端运行/观测/身份”的组合。

Cloudflare Browser Run 运行 headless Chrome,用于 browser automation、web scraping、testing、content generation。

提供 Quick Actions 和 Browser Sessions 两类集成;支持 Puppeteer、Playwright、CDP、Stagehand。

官方用例表里直接列出 AI agent browsing:Playwright MCP 或 CDP with MCP clients。

支持 session reuse、edge 运行、Markdown/screenshot/PDF/snapshot/links/structured data/crawl 等输出。

说明 Browser Agent 工程栈不只是模型,还需要运行时、会话和可观测能力。

易变事实:定价、限额、产品命名,本篇不展开。

什么任务适合 Browser Agent?

用判断表帮助读者快速决策。

判断表

适合不适合
✅ 跨站点调研对比❌ 有稳定 API 的系统
✅ 无 API 后台表单提交❌ 需要大规模并发抓取
✅ 端到端前端测试❌ 涉及敏感账号/支付/权限(需要严格审批)
✅ 需要登录态的操作(有安全边界)❌ 平台明确禁止自动化
✅ 动态内容抓取(前端渲染)❌ 高频重复任务(考虑 API 或脚本)

可执行步骤块示例

适合 Browser Agent 的典型流程:

  1. 用户给出自然语言任务:“帮我对比 5 个 SaaS 产品的定价和功能”

  2. Browser Agent 打开官网文档、定价页、功能页

  3. Agent 截图或读取 accessibility snapshot

  4. 模型理解页面内容,决定下一步动作(点击、滚动、输入)

  5. 遇到验证码或 MFA,停下来等人接手

  6. 最终输出结构化对比表

具体场景示例

一个按钮从 .submit-btn 改成 aria label 后,传统 Playwright 脚本挂了,AI 浏览器 agent 还能根据页面语义重新找目标。

后台表单提交前卡在 MFA/验证码,agent 必须停下来等人接手,而不是硬冲。

安全边界与合规

Computer Use/Browser Agent 涉及敏感操作、prompt injection、账号权限。

明确安全边界,不鼓励绕过平台规则。

安全清单

风险处理方式
网页内容不可信(prompt injection)将页面、工具输出、PDF、邮件、聊天当作不可信输入,可能影响模型行为
联网时风险更高使用低权限 VM/container、域名 allowlist、限制敏感数据
高影响操作(登录、支付、提交)必须人工确认(human-in-the-loop)
不能鼓励自动登录、绕过验证码正文不写绕过方法,只作为边界提醒
审计日志记录所有动作,可追溯
最小权限只给必要的权限,不使用 root/admin 账号
隔离环境使用 Docker/VM,不直接在主机运行

风险段落

网页内容(页面、工具输出、PDF、邮件、聊天)都是不可信输入,可能影响模型行为(prompt injection)。

联网时风险更高。需用低权限 VM/container、域名 allowlist、限制敏感数据。

高影响操作(登录、支付、提交)必须人工确认(human-in-the-loop)。

不能鼓励自动登录、绕过验证码、绕过平台规则。

审计日志、最小权限、隔离环境是必须的。

Anthropic Computer Use 文档特别提到:网页或图片里的指令可能影响模型行为,属于 prompt injection 风险。需要隔离和确认机制。

后续学习路径

本篇是系列入口页,不替代后续单篇。

已发布的站内相关文章

本系列后续专题

后续会单独写以下专题:

  • Browser Use 实战:完整 autonomous browser agent,本地或云端运行。

  • Playwright MCP 指南:通过 MCP 暴露浏览器能力,结构化 accessibility snapshot。

  • Stagehand SDK 实践:代码确定性 + AI 适应性,工程化路线。

  • 工具对比与选型:Browser Use vs Stagehand vs Playwright MCP vs Computer Use。

  • 网页抓取实战:动态内容抓取、前端渲染页面。

  • 调研对比实战:跨站点数据对比、表格生成。

  • 表单提交实战:无 API 后台表单、跨平台整合。

  • 登录态操作:session 管理、后台管理、数据导入导出(有安全边界)。

  • 重试与稳定性:selector 变化、动态 UI、错误处理。

  • 前端测试实战:端到端测试、UI 验证。

  • Codex 验证:Codex 场景下的 Computer Use / 内置浏览器。

  • 飞书看板自动化:飞书后台表单、数据移动。

  • 云基础设施选型:Browserbase、Cloudflare Browser Run、托管浏览器。

  • 合规边界:平台规则、反爬、验证码处理。

  • 安全实践:prompt injection、隔离环境、审计日志。

  • AgentScout:开源工具实践。

推荐下一步

如果你想快速上手,可以先看 OpenClaw 浏览器自动化实战或 Computer-Use Agent。

如果你想深入了解某条技术路线,后续会单独写 Playwright MCP、Stagehand、Browser Use 等专题。

最小 Browser Agent 设计步骤

限定任务、配置浏览器环境、观察页面、执行动作、验证状态,并在高风险动作前让人接手。

  1. 1

    步骤 1: 限定任务

    先写清楚目标、允许访问的网站、禁止动作和最终输出格式。
  2. 2

    步骤 2: 配置环境

    使用独立浏览器配置、单独账号和低权限运行环境。
  3. 3

    步骤 3: 观察页面

    通过截图、DOM 或 accessibility snapshot 读取当前状态。
  4. 4

    步骤 4: 执行动作

    让模型决定点击、输入、滚动等 UI 动作,再由宿主代码执行。
  5. 5

    步骤 5: 验证结果

    检查页面是否真的完成了任务,必要时重试或换路径。
  6. 6

    步骤 6: 人工确认

    登录、付款、提交表单、删除数据等高风险动作前必须停下来确认。

常见问题

Browser Agent 是不是就是爬虫?
不是。爬虫只抓取静态页面,Browser Agent 会看页面、理解内容、决定动作并执行操作。
Browser Agent 和 RPA 有什么区别?
RPA 录制回放桌面流程,不感知页面语义;Browser Agent 会根据页面状态重新判断下一步。
为什么不直接用 API?
有稳定官方 API 时应该优先用 API。Browser Agent 更适合 API 不完整、页面动态或需要临场判断的场景。
能不能自动登录、填表、提交?
可以处理,但登录、付款、提交表单、删除数据等高风险动作必须人工确认。
验证码怎么办?
不能绕过。遇到验证码或 MFA 时,agent 应该停下来等人接手。
网页里的 prompt injection 会不会让 agent 被骗?
会,所以网页内容、工具输出、PDF、邮件和聊天都应视为不可信输入,并配合隔离环境与审批机制。

13 分钟阅读 · 发布于: 2026年9月4日 · 修改于: 2026年9月4日

相关文章

BetterLink

想持续收到这个主题的更新?

你可以直接关注作者更新、订阅 RSS,或者继续沿着系列入口往下读,避免下次又回到搜索结果重新找。

关注公众号

评论

使用 GitHub 账号登录后即可评论

Easton BlogEaston Blog