agent-browser
AI浏览器自动化工具
官网: 立即访问
工具介绍
agent-browser具体信息
agent-browser 是由 Vercel Labs 于 2026 年 1 月开源的浏览器自动化命令行工具(CLI),专为 AI Agent(智能代理)设计。它的核心定位是让大模型不仅“看得懂”网页,还能“亲手操作”网页——从打开链接、点击按钮、填写表单,到截图、抓取数据、验证 Web 应用,全部可以通过自然语言或简单命令完成。
与传统浏览器自动化工具不同,agent-browser 底层采用 Rust 编写,启动速度快、资源占用低、执行稳定;它在 Playwright 之上做了大量面向 LLM 的抽象与优化,把繁琐的 CSS 选择器、浏览器驱动配置等复杂细节封装起来,让开发者和 AI Agent 都能零门槛上手,真正实现“安装即用”。
agent-browser 提供了 50 多个开箱即用的命令,覆盖以下核心能力:
1. 网页导航与交互:打开/关闭页面、点击、双击、输入、hover、拖拽、滚动、文件上传等全套浏览器操作。
2. refs 快照机制:snapshot 命令生成带唯一引用(如 @e1、@e2)的可访问性树,AI 只需按 ref 操作元素,无需猜测选择器。
3. 语义化定位:支持按 role、文本、label、placeholder、alt、data-testid 等语义方式查找元素。
4. AI 聊天模式:chat 命令支持用自然语言指挥浏览器,支持单次执行与交互式 REPL 两种模式。
5. 智能阅读:read 命令将网页转为 AI 友好的 Markdown/纯文本,支持 llms.txt、大纲、内容过滤等。
6. 截图与导出:支持全页截图、带编号标注的截图以及 PDF 导出。
7. 批量执行:batch 命令一次运行多步操作,避免进程反复启动的开销。
8. 网络控制:请求拦截、响应 mock、HAR 录制、请求追踪与过滤。
9. 会话与状态管理:Cookie/Storage 读写、多标签页与多窗口管理、iframe 切换、对话框处理。
10. 开发者能力:React 组件树内省、Web Vitals 指标、CDP 调试连接。
此外,它还内置了适配 Claude Code、Gemini、Cursor、GitHub Copilot、Codex、opencode 等主流 AI 工具的 Skills,可无缝融入现有工作流。
安装(全局安装,推荐):
npm install -g agent-browser
agent-browser install # 首次使用会自动下载 Chrome for Testing
macOS 用户也可通过 Homebrew 安装:brew install agent-browser。
快速上手(按 ref 操作元素):
agent-browser open example.com
agent-browser snapshot # 获取带 refs 的可访问性树
agent-browser click @e2 # 按 ref 点击元素
agent-browser fill @e3 "test@example.com" # 按 ref 填写表单
agent-browser screenshot page.png # 截图
agent-browser close # 关闭浏览器
使用自然语言驱动:
agent-browser chat "open google.com and search for cats"
如果想把它接入 AI 编程助手,只需下载官方 SKILL.md 文件放到对应目录(如 .claude/skills)即可。
1. 专为 AI 优化:agent-browser 通过精简数据结构,可减少最高 93% 的无关上下文,只把关键 DOM 信息与可操作元素交给 LLM,显著提升推理效率与操作准确性。
2. Rust 底层 + 常驻 daemon:CLI 用 Rust 编写,后台常驻 daemon 管理浏览器实例,命令响应接近秒级,几十步的连续复杂任务也能稳定低延迟执行。
3. refs 机制告别“选择器地狱”:快照引用与底层 DOM 结构解耦,网页改版后脚本也不易失效,稳定性大幅提升。
4. 零配置、开箱即用:自动检测已有的 Chrome、Brave、Playwright、Puppeteer 环境,无需手动安装驱动或配置复杂依赖。
5. 开放生态与可移植性:预置 Skills 可直连主流 AI 助手,支持任何可运行 Bash 的系统,甚至能在 AWS Lambda、Vercel Sandbox 等 serverless 环境中运行。
与 Playwright/Puppeteer 相比:Playwright 功能强大,但面向传统测试工程师,输出给 LLM 的上下文冗长、CSS 选择器维护成本高;agent-browser 在 Playwright 之上封装出 AI 友好的命令层,用 refs 与语义定位替代选择器,大幅降低 Agent 的使用门槛与 Token 消耗。
与浏览器 MCP 工具相比:agent-browser 是独立的 CLI 工具,不绑定特定 MCP 客户端,兼容性更广;同时提供 chat、read、batch 等专为 Agent 设计的原生能力,且可通过 --json 输出结构化数据供进一步处理。
与纯视觉驱动方案(如截图识别)相比:agent-browser 基于可访问性树与结构化数据驱动,定位更精确、Token 开销更低、结果可审计、可复现,更适合需要高可靠性的自动化测试与数据采集场景。
Q1: agent-browser 是免费的吗?
A1: 是的。agent-browser 由 Vercel Labs 开源,可在 GitHub 免费获取源码,也可以通过 npm、Homebrew、Cargo 等渠道免费安装使用。
Q2: 使用 agent-browser 需要手动安装浏览器驱动吗?
A2: 不需要。首次运行 agent-browser install 会自动下载 Chrome for Testing(Google 官方自动化渠道),同时会自动检测机器上已有的 Chrome、Brave、Playwright 与 Puppeteer 安装。
Q3: agent-browser 与 Playwright 是什么关系?
A3: agent-browser 底层基于 Playwright,但对外提供完全面向 AI Agent 的 CLI 命令层,封装了选择器、驱动配置等复杂度,无需学习 Playwright API 即可完成浏览器自动化任务。
Q4: 可以用 agent-browser 做网页数据抓取吗?
A4: 可以。它的 read、snapshot、get text 等命令能高效提取页面文本与结构化数据,并支持 Cookie/Storage 管理、网络请求追踪与 HAR 录制,适合构建爬虫与数据采集流程。请务必遵守目标网站的 robots 协议与服务条款。
Q5: agent-browser 支持哪些 AI 编程助手?
A5: 已兼容 Claude Code、Gemini、Cursor、GitHub Copilot、Codex、opencode 等主流 AI 工具,并提供官方 Skills 文件,放入对应目录即可让 AI 立即学会使用。
Q6: 在服务器或 serverless 环境能运行吗?
A6: 可以。agent-browser 支持自定义 Chromium 路径,可在 AWS Lambda、Vercel Sandbox microVM 等环境运行;在 Linux 下执行 agent-browser install --with-deps 即可安装所需的系统依赖。
agent-browser数据分析
数据更新于 2026-08-01,每月更新一次,预计15号之前完成更新,数据仅统计主域名:agent-browser.dev。
总访问量
80,130
环比变化
-10.66%
平均停留
00:00:33
跳出率
47.50%
- 直接访问 52.19%
- 搜索引擎 33.36%
- 引荐流量 10.80%
- 社交媒体 1.72%
- 邮件 0.52%
- 其他 1.41%
- China 21.33%
- United States 17.01%
- India 4.39%
- Brazil 3.85%
- Singapore 3.63%