Browser-Use 深度调研:让 AI Agent 像人一样操作浏览器的开源框架
Browser-Use 深度调研:让 AI Agent 像人一样操作浏览器的开源框架
调研时间:2026-08-13
数据来源:GitHub 官方仓库(实时 API)、官方文档 docs.browser-use.com、PyPI、本地实测
项目地址:https://github.com/browser-use/browser-use
目录
- 项目概况
- 核心定位与价值
- 架构与设计理念
- 核心特性详解
- 安装与快速上手
- 用法 Demo
- 模型支持
- 竞品对比分析
- 商业版本与定价
- 版本演进与兼容性警告
- 综合评分与选型建议
- 参考资源
1. 项目概况
| 指标 | 数值 |
|---|---|
| GitHub Stars | 108,967(调研当日实时) |
| Forks | 11,972 |
| 主要语言 | Python |
| 许可证 | MIT(宽松商业友好) |
| 创建时间 | 2024-10-31 |
| 最近活跃 | 2026-08-12(持续高频更新) |
| PyPI 最新版本 | 0.13.7(2026-07-27) |
| 最低 Python | >= 3.11(官方推荐 3.12) |
| 一句话定位 | 🌐让 AI Agent 使用浏览器的人类操作方式:打开页面、点击、输入、填表 |
Browser-Use 是一个让大语言模型(LLM)驱动真实浏览器完成任务的 Python 框架。你只需描述任务(自然语言),它就能像人一样:
- 打开网页
- 点击按钮
- 填写表单
- 提取数据
- 多步骤完成任务
它目前是AI Agent 浏览器操控领域的绝对头部项目:
- Odysseys 基准测试第一名:87.4% 平均分,超过 OpenAI、Anthropic、Google、Microsoft 的 computer-use agent
- 在 200 个长时程网页任务的基准上领先
2. 核心定位与价值
它解决什么问题?
传统网页自动化(Selenium/Playwright)需要你手写每一步操作:
# Playwright:写死每一步page.goto("https://example.com/login")page.fill("#username","myuser")page.fill("#password","mypass")page.click("#submit")Browser-Use 则是用对话驱动:
frombrowser_useimportAgent,ChatOpenAI agent=Agent(task="登录 example.com,使用 myuser/mypass,然后发布一条状态",llm=llm,)awaitagent.run()LLM 自动决定每一步:打开哪个页面、点哪个按钮、填什么内容、出错怎么纠正。
关键区别:是"浏览器操控层"不是"爬虫框架"
| 类型 | 代表 | 定位 |
|---|---|---|
| 浏览器操控 Agent | Browser-Use | 让 AI 操作浏览器干活 |
| 爬虫框架 | Selenium / Playwright / Scrapling | 网页数据抓取 |
| LLM 友好爬虫 | Crawl4AI | 生产干净 Markdown 供 RAG/Agent 消费 |
| 网站数据 API | Firecrawl | 云优先的网页数据服务 |
Browser-Use 适合的是需要"做事"的场景:填表、点按钮、多步骤流程、交互式任务,而不只是抓数据。
3. 架构与设计理念
3.1 包结构(GitHub main 分支)
browser_use/ ├── agent/ # 核心 Agent 循环(service.py = Agent 类) │ ├── message_manager/ # 消息历史管理 │ ├── system_prompts/ # 系统提示词模板 │ └── prompts.py ├── actor/ # 动作执行器 ├── browser/ # 浏览器会话管理(BrowserSession / BrowserProfile) ├── controller/ # 动作注册器(可扩展自定义工具) ├── dom/ # DOM 解析与元素定位 ├── llm/ # 多提供商 LLM 封装(OpenAI/Google/Anthropic/BrowserUse 自家) ├── tools/ # 内置工具 ├── mcp/ # MCP (Model Context Protocol) 集成 ├── telemetry/ # 遥测(匿名) ├── skills/ # Agent 技能 └── cli.py # CLI 入口3.2 核心运行循环
用户任务(自然语言) ↓ Agent 类(agent/service.py) ↓ 生成下一步动作(LLM 决策) Controller 动作注册表(打开/点击/输入/滚动/截图...) ↓ Browser 会话(真实 Chrome 通过 CDP 控制) ↓ 观察新页面状态(DOM 摘要 + 可选截图) ↓ Agent 评估结果 → 下一步或完成这是典型的ReAct(Reasoning + Acting)循环:LLM 每步推理 → 执行动作 → 观察结果 → 再推理。
3.3 本地实测的本机 API(0.12.9)结构
本机实测发现 0.12.9 已重构为 Browser Harness 架构:
frombrowser_use.agent.serviceimportAgent# Agent 类frombrowser_use.browserimportBrowserSession,BrowserProfile# 浏览器会话frombrowser_use.llm.modelsimportChatOpenAI# LLM 封装4. 核心特性详解
4.1 Agent:智能任务执行 🧠
- 自然语言任务驱动,自动分解为多步浏览器操作
- 支持max_steps限制、中断/暂停控制
- 内置结构化输出(AgentStructuredOutput):直接得到 JSON 而不是文本
- 支持技能(Skills):注册子技能作为可调用的 action
4.2 自定义工具扩展 🔧
frombrowser_useimportTools tools=Tools()@tools.action(description='计算两个数字之和')defcustom_add(a:int,b:int)->int:returna+b agent=Agent(task="...",llm=llm,tools=tools)4.3 浏览器控制 🌐
- 默认启动全新 Chromium 实例
- 支持复用真实 Chrome profile(保留登录态):
# examples/browser/real_browser.pybrowser=BrowserProfile(chrome_instance_path="/Applications/Google Chrome.app/Contents/MacOS/Google Chrome",# 使用你的真实 profile,登录态保留)- 支持无头模式、视口配置、代理设置
- 远程浏览器(Cloud Browser)支持隐身指纹与代理轮换
4.4 认证与登录 🔐
- 真实浏览器 profile 复用:保留 cookie 和会话
- 临时收件箱 AgentMail:注册临时账户收验证码
- profile sync:本地 profile 同步到远程浏览器
4.5 CLI(Browser-Use CLI 3.0)🖥️
0.13.3 起发布的 CLI 3.0 由 Browser Harness 驱动:
browser-use install # 安装 Chromium + 依赖 browser-use open <url> # 打开页面 browser-use click N # 点击元素 browser-use type ... # 输入文本 browser-use extract ... # LLM 提取数据 browser-use eval ... # 执行 JS browser-use connect # 连接现有 Chrome(CDP) browser-use sessions # 会话管理 browser-use profile # profile 管理安装了browser-use skill后,Claude Code / Codex / Cursor / Hermes 等 Agent 可以直接通过 skill 控制浏览器。
4.6 MCP 集成
内置 MCP server,任何支持 MCP 的 Agent 都可以接入 Browser-Use 的浏览器能力。
4.7 反爬与验证码
- 开源版:普通浏览器自动化,反爬能力有限
- Cloud 版:隐身浏览器指纹 + 代理轮换 + CAPTCHA 自动解决(官方明确推荐用 Cloud 解决反爬)
4.8 遥测
默认开启匿名遥测(可关闭),符合现代开源工具标准。
5. 安装与快速上手
安装(官方推荐方式)
# 1. 创建环境(推荐 Python 3.12)pipinstalluv uv venv--python3.12source.venv/bin/activate# Windows: .venv\Scripts\activate# 2. 安装 browser-use 与 Chromiumuv pipinstallbrowser-use uvx browser-useinstall配置 LLM
创建.env文件,填入你的模型 API key。支持:
| 提供商 | 环境变量 |
|---|---|
| Browser Use 自家模型(推荐) | BROWSER_USE_API_KEY(新用户 5 次免费) |
| OpenAI | OPENAI_API_KEY |
| Google Gemini | GOOGLE_API_KEY |
| Anthropic | ANTHROPIC_API_KEY |
| 本地 Ollama | 无需 key |
首次运行
frombrowser_useimportAgent,ChatOpenAIfromdotenvimportload_dotenvimportasyncio load_dotenv()asyncdefmain():llm=ChatOpenAI(model="gpt-4o")# 也可用 ChatGoogle / ChatAnthropic / ChatBrowserUseagent=Agent(task="Find the number 1 post on Show HN",llm=llm,)awaitagent.run()if__name__=="__main__":asyncio.run(main())本地实测要点(macOS)
- Python 3.11+ 是硬性要求(低于 3.11 直接无法安装)
browser-use install需下载 Chromium(国内网络可能较慢,可用系统 Chrome 替代:BrowserProfile(chrome_instance_path=...))- Agent API 是async(
await agent.run()),不要漏掉asyncio.run() - 免费开源模型(如本地 Ollama 或第三方免费 API)可以跑,但复杂任务正确率明显低于商业模型
6. 用法 Demo
6.1 最简示例
frombrowser_useimportAgent,ChatGoogle agent=Agent(task="搜索 '今日天气' 并告诉我结果",llm=ChatGoogle())awaitagent.run()6.2 填表单
frombrowser_useimportAgent,ChatOpenAI agent=Agent(task="打开 jobs.example.com,用我的简历信息填写这份求职申请",llm=ChatOpenAI(model="gpt-4o"),)awaitagent.run()6.3 数据提取导出 CSV
frombrowser_useimportAgent,ChatBrowserUse agent=Agent(task="提取我的粉丝列表中的结构化数据并导出为 CSV",llm=ChatBrowserUse(),)awaitagent.run()6.4 结构化输出(JSON Schema)
frombrowser_useimportAgent,AgentStructuredOutputfrompydanticimportBaseModelclassProduct(BaseModel):name:strprice:floatin_stock:boolagent=Agent(task="提取这个商品页的信息",llm=llm,output_model_schema=Product,# 直接得到结构化对象)6.5 复用真实 Chrome(登录态)
frombrowser_useimportAgent,BrowserProfile,ChatOpenAI browser=BrowserProfile(chrome_instance_path="/Applications/Google Chrome.app/Contents/MacOS/Google Chrome",user_data_dir="~/.chrome-profile-with-login",# 你的带登录态的 profile)agent=Agent(task="检查我的 Gmail 新邮件",llm=llm,browser=browser)awaitagent.run()6.6 自定义工具
frombrowser_useimportAgent,Tools tools=Tools()@tools.action(description='获取当前股票价格')defget_stock_price(ticker:str)->str:returnf"{ticker}: $100.00"# 这里接真实 APIagent=Agent(task="检查 AAPL 股价并搜索相关新闻",llm=llm,tools=tools)awaitagent.run()6.7 CLI 方式(配合 Agent 使用)
# 交给 Agent(Claude Code/Codex/Cursor/Hermes)执行browser-useopenhttps://example.com browser-use click2browser-usetype"Hello"--element3browser-use extract--query"页面上的主要内容"6.8 QA 自动化
agent=Agent(task="QA 测试我的本地网站,报告任何 bug、可用性问题和视觉不一致",llm=llm,)awaitagent.run()7. 模型支持
7.1 ChatBrowserUse(自家优化模型)🔥
Browser-Use 官方推出了专门为浏览器自动化优化的模型:
bu-*系列:任务完成速度比普通模型快 3-5 倍- 通过一个
BROWSER_USE_API_KEY即可访问 Claude/GPT/Gemini 多个模型(provider-prefix 格式)
frombrowser_useimportAgent,ChatBrowserUse llm=ChatBrowserUse(model='anthropic/claude-sonnet-4-6')# 或 'openai/gpt-5.5'agent=Agent(task='...',llm=llm)7.2 开源预览模型
llm=ChatBrowserUse(model='browser-use/bu-30b-a3b-preview')配合官方默认系统提示词直接可用,无需额外自定义。
7.3 常规提供商
| 提供商 | 类 | 示例模型 |
|---|---|---|
| OpenAI | ChatOpenAI | gpt-4o / gpt-5.5 |
ChatGoogle | gemini-flash-latest | |
| Anthropic | ChatAnthropic | claude-sonnet-4-6 |
| Browser Use | ChatBrowserUse | bu-* 系列 |
| 本地 / 任意 OpenAI 兼容 | ChatOpenAI(base_url=...) | Ollama 等 |
8. 竞品对比分析
8.1 四工具横向对比(调研当日实时数据)
| 维度 | Browser-Use | Crawl4AI | Scrapling | Firecrawl |
|---|---|---|---|---|
| Stars | 108,967 | 77,000+ | 73,000+ | 155,000+ |
| 许可证 | MIT | Apache-2.0 | BSD-3-Clause | AGPL-3.0 |
| 语言 | Python | Python | Python | TypeScript |
| 创建时间 | 2024-10 | 2024-05 | 2024-10 | 2024-04 |
| 核心能力 | AI 操作浏览器 | LLM 爬虫出 Markdown | 反爬最强 | 云 API 一站式 |
| 反爬能力 | 一般(Cloud 版强) | 中 | 最强 | 强 |
| LLM 集成 | 原生(架构核心) | 提取策略之一 | 无重点 | 有 |
| 本地免费 | ✅ | ✅ | ✅ | ❌(云服务) |
| 交互式任务(点击/填表) | ✅唯一擅长 | ❌ | ❌ | ⚠️ 有限 |
8.2 与 Playwright / Selenium 的区别
| 维度 | Browser-Use | Playwright | Selenium |
|---|---|---|---|
| 驱动方式 | LLM 自动决策 | 代码写死 | 代码写死 |
| 学习成本 | 极低(描述任务) | 中(学 API) | 中 |
| 稳定性 | 依赖模型正确率 | 代码即稳定 | 代码即稳定 |
| 反爬 | 一般 | 一般 | 低 |
| 适用 | AI 任务自动化 | 精确可重复测试/抓取 | 传统 WebDriver 兼容 |
核心结论:Browser-Use 不是来替代 Playwright/Selenium 的,而是补上"AI 自主决策"这一层。生产级爬虫和精确测试仍然用 Playwright/Selenium 更可控。
8.3 各自的不可替代优势
| 工具 | 最亮眼的能力 |
|---|---|
| Browser-Use | 唯一成熟的"让 AI 操作浏览器"开源框架;Odysseys 榜第一 |
| Crawl4AI | 自适应爬取 + 四种提取策略 + 双通道 Markdown,RAG 首选 |
| Scrapling | 开箱绕过 Cloudflare Turnstile;比 BeautifulSoup 快 784x |
| Firecrawl | 零配置 7 大 API,云优先,P95 3.4s |
9. 商业版本与定价
9.1 双版本策略
| 开源版 | Cloud(商业托管) | |
|---|---|---|
| 成本 | 免费(自带 LLM key) | 按量付费(新用户 5 次免费任务) |
| 浏览器 | 本地 Chrome/Chromium | 云端托管浏览器 |
| 反爬 | 无特殊处理 | 隐身指纹 + 代理轮换 + CAPTCHA 解决 |
| 集成 | 108+ 集成 | 1000+ 集成(Gmail/Slack/Notion 等) |
| 持久化 | 本地文件 | 持久文件系统 + 记忆 |
| 并行 | 需自管 | 高性能并行执行 |
9.2 API 版本
- API V4:推荐,高精度,适合长复杂工作流(当前主推 gpt-5.6-luna 模型)
- API V2:低成本、速度优先,精度较低
9.3 授权要点(MIT 许可)
- 开源版 MIT 许可 → 可自由商用、修改
- 注意区分:Cloud 服务有自己的 ToS 和隐私政策(非 MIT)
10. 版本演进与兼容性警告 ⚠️
10.1 API 正在快速重构(重要)
| 版本 | 变化 |
|---|---|
| <= 0.8.x | 稳定经典 API(Agent + Browser + BrowserConfig) |
| 0.12.x | Browser Harness 重构:BrowserSession/BrowserProfile取代旧Browser;导出变 lazy |
| 0.13.x(当前) | CLI 3.0 + Browser Harness 0.1.6;ChatBrowserUse强化 |
| 0.13.7 | 最新稳定(2026-07-27) |
踩坑实测:
- 本机实测 0.12.9:
from browser_use import Browser, LLM会报 ImportError from browser_use.agent.service import Agent可用,但browser_use.browser.service已不存在- 老教程代码大概率失效,看文档一定要对版本(
docs.browser-use.com的 Get Started 是 0.13.x 标准)
10.2 免费模型使用注意事项
- 开源版免费,但需要自带 LLM API key(OpenAI/Google/Claude 或本地 Ollama)
- 用第三方免费 API 兼容模型可以跑通,但:
- 复杂任务正确率明显下降
- 响应可能超时(本地实测 hy3-free 模型 5 分钟未完成 4 步任务)
- 想要高准确率建议用官方
bu-*模型(有免费额度)
11. 综合评分与选型建议
11.1 评分(1-10)
| 维度 | 分数 | 说明 |
|---|---|---|
| 社区热度 | 10 | 108K stars,增长迅猛 |
| 易用性 | 9 | 自然语言驱动,上手极快 |
| 架构设计 | 8 | ReAct 循环清晰,模块化好 |
| 可扩展性 | 9 | 自定义工具/Skills/MCP |
| 稳定性 | 7 | API 快速演进,需锁版本 |
| 反爬能力 | 5 | 开源版弱,需 Cloud |
| 商业友好 | 9 | MIT + 明确的双版本策略 |
| 文档质量 | 8 | 官方文档完善,但版本漂移 |
11.2 选型建议
| 场景 | 推荐 |
|---|---|
| AI Agent 操作浏览器干活(填表/点按钮/QA) | ✅Browser-Use(唯一选择) |
| RAG 管道抓网页转 Markdown | Crawl4AI |
| 绕过反爬抓数据 | Scrapling |
| 云 API 快速集成抓取 | Firecrawl |
| 精确可重复的自动化测试 | Playwright / Selenium |
| 编程 Agent 临时用浏览器 | Browser-Use CLI + skill |
11.3 适合你吗?
适合:
- 想用自然语言让 AI 完成网页操作(AI Agent 场景)
- 做 Web QA 自动化
- 把浏览器能力接入 Claude Code / Codex / Cursor 等编码 Agent
- 需要结构化数据提取 + 后续行动(不只抓数据)
不适合:
- 大规模数据采集(数据抓取用 Crawl4AI/Scrapling 更高效)
- 对每一步都要精确控制的场景(用 Playwright 写死更可靠)
- 免费低成本大批量任务(LLM token 成本不低)
12. 参考资源
- GitHub:https://github.com/browser-use/browser-use(108,967 stars, MIT)
- 官方文档:https://docs.browser-use.com
- 官方主页:https://browser-use.com
- Cloud 控制台:https://cloud.browser-use.com
- PyPI:https://pypi.org/project/browser-use/(v0.13.7)
- Odyssey 榜:https://odysseysbench.com/leaderboard
报告完 · Happy Browsing!
