当前位置: 首页 > news >正文

Browser-Use 深度调研:让 AI Agent 像人一样操作浏览器的开源框架

Browser-Use 深度调研:让 AI Agent 像人一样操作浏览器的开源框架

调研时间:2026-08-13
数据来源:GitHub 官方仓库(实时 API)、官方文档 docs.browser-use.com、PyPI、本地实测
项目地址:https://github.com/browser-use/browser-use


目录

  1. 项目概况
  2. 核心定位与价值
  3. 架构与设计理念
  4. 核心特性详解
  5. 安装与快速上手
  6. 用法 Demo
  7. 模型支持
  8. 竞品对比分析
  9. 商业版本与定价
  10. 版本演进与兼容性警告
  11. 综合评分与选型建议
  12. 参考资源

1. 项目概况

指标数值
GitHub Stars108,967(调研当日实时)
Forks11,972
主要语言Python
许可证MIT(宽松商业友好)
创建时间2024-10-31
最近活跃2026-08-12(持续高频更新)
PyPI 最新版本0.13.7(2026-07-27)
最低 Python>= 3.11(官方推荐 3.12)
一句话定位🌐让 AI Agent 使用浏览器的人类操作方式:打开页面、点击、输入、填表

Browser-Use 是一个让大语言模型(LLM)驱动真实浏览器完成任务的 Python 框架。你只需描述任务(自然语言),它就能像人一样:

  • 打开网页
  • 点击按钮
  • 填写表单
  • 提取数据
  • 多步骤完成任务

它目前是AI Agent 浏览器操控领域的绝对头部项目

  • Odysseys 基准测试第一名:87.4% 平均分,超过 OpenAI、Anthropic、Google、Microsoft 的 computer-use agent
  • 在 200 个长时程网页任务的基准上领先

2. 核心定位与价值

它解决什么问题?

传统网页自动化(Selenium/Playwright)需要你手写每一步操作

# Playwright:写死每一步page.goto("https://example.com/login")page.fill("#username","myuser")page.fill("#password","mypass")page.click("#submit")

Browser-Use 则是用对话驱动

frombrowser_useimportAgent,ChatOpenAI agent=Agent(task="登录 example.com,使用 myuser/mypass,然后发布一条状态",llm=llm,)awaitagent.run()

LLM 自动决定每一步:打开哪个页面、点哪个按钮、填什么内容、出错怎么纠正。

关键区别:是"浏览器操控层"不是"爬虫框架"

类型代表定位
浏览器操控 AgentBrowser-Use让 AI 操作浏览器干活
爬虫框架Selenium / Playwright / Scrapling网页数据抓取
LLM 友好爬虫Crawl4AI生产干净 Markdown 供 RAG/Agent 消费
网站数据 APIFirecrawl云优先的网页数据服务

Browser-Use 适合的是需要"做事"的场景:填表、点按钮、多步骤流程、交互式任务,而不只是抓数据。


3. 架构与设计理念

3.1 包结构(GitHub main 分支)

browser_use/ ├── agent/ # 核心 Agent 循环(service.py = Agent 类) │ ├── message_manager/ # 消息历史管理 │ ├── system_prompts/ # 系统提示词模板 │ └── prompts.py ├── actor/ # 动作执行器 ├── browser/ # 浏览器会话管理(BrowserSession / BrowserProfile) ├── controller/ # 动作注册器(可扩展自定义工具) ├── dom/ # DOM 解析与元素定位 ├── llm/ # 多提供商 LLM 封装(OpenAI/Google/Anthropic/BrowserUse 自家) ├── tools/ # 内置工具 ├── mcp/ # MCP (Model Context Protocol) 集成 ├── telemetry/ # 遥测(匿名) ├── skills/ # Agent 技能 └── cli.py # CLI 入口

3.2 核心运行循环

用户任务(自然语言) ↓ Agent 类(agent/service.py) ↓ 生成下一步动作(LLM 决策) Controller 动作注册表(打开/点击/输入/滚动/截图...) ↓ Browser 会话(真实 Chrome 通过 CDP 控制) ↓ 观察新页面状态(DOM 摘要 + 可选截图) ↓ Agent 评估结果 → 下一步或完成

这是典型的ReAct(Reasoning + Acting)循环:LLM 每步推理 → 执行动作 → 观察结果 → 再推理。

3.3 本地实测的本机 API(0.12.9)结构

本机实测发现 0.12.9 已重构为 Browser Harness 架构:

frombrowser_use.agent.serviceimportAgent# Agent 类frombrowser_use.browserimportBrowserSession,BrowserProfile# 浏览器会话frombrowser_use.llm.modelsimportChatOpenAI# LLM 封装

4. 核心特性详解

4.1 Agent:智能任务执行 🧠

  • 自然语言任务驱动,自动分解为多步浏览器操作
  • 支持max_steps限制、中断/暂停控制
  • 内置结构化输出(AgentStructuredOutput):直接得到 JSON 而不是文本
  • 支持技能(Skills):注册子技能作为可调用的 action

4.2 自定义工具扩展 🔧

frombrowser_useimportTools tools=Tools()@tools.action(description='计算两个数字之和')defcustom_add(a:int,b:int)->int:returna+b agent=Agent(task="...",llm=llm,tools=tools)

4.3 浏览器控制 🌐

  • 默认启动全新 Chromium 实例
  • 支持复用真实 Chrome profile(保留登录态):
# examples/browser/real_browser.pybrowser=BrowserProfile(chrome_instance_path="/Applications/Google Chrome.app/Contents/MacOS/Google Chrome",# 使用你的真实 profile,登录态保留)
  • 支持无头模式、视口配置、代理设置
  • 远程浏览器(Cloud Browser)支持隐身指纹与代理轮换

4.4 认证与登录 🔐

  • 真实浏览器 profile 复用:保留 cookie 和会话
  • 临时收件箱 AgentMail:注册临时账户收验证码
  • profile sync:本地 profile 同步到远程浏览器

4.5 CLI(Browser-Use CLI 3.0)🖥️

0.13.3 起发布的 CLI 3.0 由 Browser Harness 驱动:

browser-use install # 安装 Chromium + 依赖 browser-use open <url> # 打开页面 browser-use click N # 点击元素 browser-use type ... # 输入文本 browser-use extract ... # LLM 提取数据 browser-use eval ... # 执行 JS browser-use connect # 连接现有 Chrome(CDP) browser-use sessions # 会话管理 browser-use profile # profile 管理

安装了browser-use skill后,Claude Code / Codex / Cursor / Hermes 等 Agent 可以直接通过 skill 控制浏览器。

4.6 MCP 集成

内置 MCP server,任何支持 MCP 的 Agent 都可以接入 Browser-Use 的浏览器能力。

4.7 反爬与验证码

  • 开源版:普通浏览器自动化,反爬能力有限
  • Cloud 版:隐身浏览器指纹 + 代理轮换 + CAPTCHA 自动解决(官方明确推荐用 Cloud 解决反爬)

4.8 遥测

默认开启匿名遥测(可关闭),符合现代开源工具标准。


5. 安装与快速上手

安装(官方推荐方式)

# 1. 创建环境(推荐 Python 3.12)pipinstalluv uv venv--python3.12source.venv/bin/activate# Windows: .venv\Scripts\activate# 2. 安装 browser-use 与 Chromiumuv pipinstallbrowser-use uvx browser-useinstall

配置 LLM

创建.env文件,填入你的模型 API key。支持:

提供商环境变量
Browser Use 自家模型(推荐)BROWSER_USE_API_KEY(新用户 5 次免费)
OpenAIOPENAI_API_KEY
Google GeminiGOOGLE_API_KEY
AnthropicANTHROPIC_API_KEY
本地 Ollama无需 key

首次运行

frombrowser_useimportAgent,ChatOpenAIfromdotenvimportload_dotenvimportasyncio load_dotenv()asyncdefmain():llm=ChatOpenAI(model="gpt-4o")# 也可用 ChatGoogle / ChatAnthropic / ChatBrowserUseagent=Agent(task="Find the number 1 post on Show HN",llm=llm,)awaitagent.run()if__name__=="__main__":asyncio.run(main())

本地实测要点(macOS)

  • Python 3.11+ 是硬性要求(低于 3.11 直接无法安装)
  • browser-use install需下载 Chromium(国内网络可能较慢,可用系统 Chrome 替代:BrowserProfile(chrome_instance_path=...)
  • Agent API 是asyncawait agent.run()),不要漏掉asyncio.run()
  • 免费开源模型(如本地 Ollama 或第三方免费 API)可以跑,但复杂任务正确率明显低于商业模型

6. 用法 Demo

6.1 最简示例

frombrowser_useimportAgent,ChatGoogle agent=Agent(task="搜索 '今日天气' 并告诉我结果",llm=ChatGoogle())awaitagent.run()

6.2 填表单

frombrowser_useimportAgent,ChatOpenAI agent=Agent(task="打开 jobs.example.com,用我的简历信息填写这份求职申请",llm=ChatOpenAI(model="gpt-4o"),)awaitagent.run()

6.3 数据提取导出 CSV

frombrowser_useimportAgent,ChatBrowserUse agent=Agent(task="提取我的粉丝列表中的结构化数据并导出为 CSV",llm=ChatBrowserUse(),)awaitagent.run()

6.4 结构化输出(JSON Schema)

frombrowser_useimportAgent,AgentStructuredOutputfrompydanticimportBaseModelclassProduct(BaseModel):name:strprice:floatin_stock:boolagent=Agent(task="提取这个商品页的信息",llm=llm,output_model_schema=Product,# 直接得到结构化对象)

6.5 复用真实 Chrome(登录态)

frombrowser_useimportAgent,BrowserProfile,ChatOpenAI browser=BrowserProfile(chrome_instance_path="/Applications/Google Chrome.app/Contents/MacOS/Google Chrome",user_data_dir="~/.chrome-profile-with-login",# 你的带登录态的 profile)agent=Agent(task="检查我的 Gmail 新邮件",llm=llm,browser=browser)awaitagent.run()

6.6 自定义工具

frombrowser_useimportAgent,Tools tools=Tools()@tools.action(description='获取当前股票价格')defget_stock_price(ticker:str)->str:returnf"{ticker}: $100.00"# 这里接真实 APIagent=Agent(task="检查 AAPL 股价并搜索相关新闻",llm=llm,tools=tools)awaitagent.run()

6.7 CLI 方式(配合 Agent 使用)

# 交给 Agent(Claude Code/Codex/Cursor/Hermes)执行browser-useopenhttps://example.com browser-use click2browser-usetype"Hello"--element3browser-use extract--query"页面上的主要内容"

6.8 QA 自动化

agent=Agent(task="QA 测试我的本地网站,报告任何 bug、可用性问题和视觉不一致",llm=llm,)awaitagent.run()

7. 模型支持

7.1 ChatBrowserUse(自家优化模型)🔥

Browser-Use 官方推出了专门为浏览器自动化优化的模型

  • bu-*系列:任务完成速度比普通模型快 3-5 倍
  • 通过一个BROWSER_USE_API_KEY即可访问 Claude/GPT/Gemini 多个模型(provider-prefix 格式)
frombrowser_useimportAgent,ChatBrowserUse llm=ChatBrowserUse(model='anthropic/claude-sonnet-4-6')# 或 'openai/gpt-5.5'agent=Agent(task='...',llm=llm)

7.2 开源预览模型

llm=ChatBrowserUse(model='browser-use/bu-30b-a3b-preview')

配合官方默认系统提示词直接可用,无需额外自定义。

7.3 常规提供商

提供商示例模型
OpenAIChatOpenAIgpt-4o / gpt-5.5
GoogleChatGooglegemini-flash-latest
AnthropicChatAnthropicclaude-sonnet-4-6
Browser UseChatBrowserUsebu-* 系列
本地 / 任意 OpenAI 兼容ChatOpenAI(base_url=...)Ollama 等

8. 竞品对比分析

8.1 四工具横向对比(调研当日实时数据)

维度Browser-UseCrawl4AIScraplingFirecrawl
Stars108,96777,000+73,000+155,000+
许可证MITApache-2.0BSD-3-ClauseAGPL-3.0
语言PythonPythonPythonTypeScript
创建时间2024-102024-052024-102024-04
核心能力AI 操作浏览器LLM 爬虫出 Markdown反爬最强云 API 一站式
反爬能力一般(Cloud 版强)最强
LLM 集成原生(架构核心)提取策略之一无重点
本地免费❌(云服务)
交互式任务(点击/填表)唯一擅长⚠️ 有限

8.2 与 Playwright / Selenium 的区别

维度Browser-UsePlaywrightSelenium
驱动方式LLM 自动决策代码写死代码写死
学习成本极低(描述任务)中(学 API)
稳定性依赖模型正确率代码即稳定代码即稳定
反爬一般一般
适用AI 任务自动化精确可重复测试/抓取传统 WebDriver 兼容

核心结论:Browser-Use 不是来替代 Playwright/Selenium 的,而是补上"AI 自主决策"这一层。生产级爬虫和精确测试仍然用 Playwright/Selenium 更可控。

8.3 各自的不可替代优势

工具最亮眼的能力
Browser-Use唯一成熟的"让 AI 操作浏览器"开源框架;Odysseys 榜第一
Crawl4AI自适应爬取 + 四种提取策略 + 双通道 Markdown,RAG 首选
Scrapling开箱绕过 Cloudflare Turnstile;比 BeautifulSoup 快 784x
Firecrawl零配置 7 大 API,云优先,P95 3.4s

9. 商业版本与定价

9.1 双版本策略

开源版Cloud(商业托管)
成本免费(自带 LLM key)按量付费(新用户 5 次免费任务)
浏览器本地 Chrome/Chromium云端托管浏览器
反爬无特殊处理隐身指纹 + 代理轮换 + CAPTCHA 解决
集成108+ 集成1000+ 集成(Gmail/Slack/Notion 等)
持久化本地文件持久文件系统 + 记忆
并行需自管高性能并行执行

9.2 API 版本

  • API V4:推荐,高精度,适合长复杂工作流(当前主推 gpt-5.6-luna 模型)
  • API V2:低成本、速度优先,精度较低

9.3 授权要点(MIT 许可)

  • 开源版 MIT 许可 → 可自由商用、修改
  • 注意区分:Cloud 服务有自己的 ToS 和隐私政策(非 MIT)

10. 版本演进与兼容性警告 ⚠️

10.1 API 正在快速重构(重要)

版本变化
<= 0.8.x稳定经典 API(Agent + Browser + BrowserConfig)
0.12.xBrowser Harness 重构BrowserSession/BrowserProfile取代旧Browser;导出变 lazy
0.13.x(当前)CLI 3.0 + Browser Harness 0.1.6;ChatBrowserUse强化
0.13.7最新稳定(2026-07-27)

踩坑实测

  • 本机实测 0.12.9:from browser_use import Browser, LLM会报 ImportError
  • from browser_use.agent.service import Agent可用,但browser_use.browser.service已不存在
  • 老教程代码大概率失效,看文档一定要对版本(docs.browser-use.com的 Get Started 是 0.13.x 标准)

10.2 免费模型使用注意事项

  • 开源版免费,但需要自带 LLM API key(OpenAI/Google/Claude 或本地 Ollama)
  • 用第三方免费 API 兼容模型可以跑通,但:
    • 复杂任务正确率明显下降
    • 响应可能超时(本地实测 hy3-free 模型 5 分钟未完成 4 步任务)
  • 想要高准确率建议用官方bu-*模型(有免费额度)

11. 综合评分与选型建议

11.1 评分(1-10)

维度分数说明
社区热度10108K stars,增长迅猛
易用性9自然语言驱动,上手极快
架构设计8ReAct 循环清晰,模块化好
可扩展性9自定义工具/Skills/MCP
稳定性7API 快速演进,需锁版本
反爬能力5开源版弱,需 Cloud
商业友好9MIT + 明确的双版本策略
文档质量8官方文档完善,但版本漂移

11.2 选型建议

场景推荐
AI Agent 操作浏览器干活(填表/点按钮/QA)Browser-Use(唯一选择)
RAG 管道抓网页转 MarkdownCrawl4AI
绕过反爬抓数据Scrapling
云 API 快速集成抓取Firecrawl
精确可重复的自动化测试Playwright / Selenium
编程 Agent 临时用浏览器Browser-Use CLI + skill

11.3 适合你吗?

适合

  • 想用自然语言让 AI 完成网页操作(AI Agent 场景)
  • 做 Web QA 自动化
  • 把浏览器能力接入 Claude Code / Codex / Cursor 等编码 Agent
  • 需要结构化数据提取 + 后续行动(不只抓数据)

不适合

  • 大规模数据采集(数据抓取用 Crawl4AI/Scrapling 更高效)
  • 对每一步都要精确控制的场景(用 Playwright 写死更可靠)
  • 免费低成本大批量任务(LLM token 成本不低)

12. 参考资源

  • GitHub:https://github.com/browser-use/browser-use(108,967 stars, MIT)
  • 官方文档:https://docs.browser-use.com
  • 官方主页:https://browser-use.com
  • Cloud 控制台:https://cloud.browser-use.com
  • PyPI:https://pypi.org/project/browser-use/(v0.13.7)
  • Odyssey 榜:https://odysseysbench.com/leaderboard

报告完 · Happy Browsing!

http://www.jsqmd.com/news/1390108/

相关文章:

  • Excel多表高效协同:从并排查看、同步滚动到VBA自动化实战
  • 使用DiskGenius无损调整分区:C盘扩容原理与实战指南
  • Blendy核心功能详解:从基础到高级的元素过渡技巧
  • MathorCup数学建模竞赛C题深度解析:从运筹优化到算法求解的实战策略
  • 做一套能带来订单的地板网站建设方案,别花冤枉钱,这套干货帮你理清思路
  • 微信网站建设咨询如何避坑:从架构到营销,揭秘企业数字化转型的核心逻辑
  • KeeperFX:为什么一个开源重制项目,能让 1997 年的经典游戏重生?
  • m3u8视频下载工具m3u8_downloader实战手记:从解析HLS流到批量保存本地视频
  • 扣子工作流详解
  • 2026年闵行纯棉布回收公司推荐指南:三招教你甄选靠谱服务商 - geo交流
  • 在gitea里把 pip 下载缓存全局持久化
  • IntelliJ IDEA中Scala开发环境搭建与HelloWorld实战指南
  • 再论勾股定理成立的条件-3
  • Kafka里实时消费Oracle变更数据,除了Debezium还有什么选择?
  • Windows系统文件TransferTargets.dll丢失找不到问题解决
  • ONNX格式转换与部署:DTLN模型跨平台应用最佳实践
  • 从原理到实践:深入理解向量化与Embedding技术及其在AI应用中的核心作用
  • ruby-lsp-rails:提升Rails开发效率的终极Ruby LSP插件
  • 阿里云Elasticsearch 9.4 Agent Builder实战:构建智能日志分析AI助手
  • 2026年铅山电路板回收找哪家?这份严选指南给你择优答案 - geo交流
  • 近期雅思笔记【截至2026.8.13】
  • Windows系统文件UefiCsp.dll丢失找不到问题解决
  • 笔试强训 Day 42:最大差值、兑换零钱、小红的子串
  • 智能座舱电磁屏蔽:导电泡棉在车载大屏与域控制器中的应用
  • A02_Python 取 A 股数据:不装 SDK,只用 requests 的 3 行写
  • 如何快速上手TeXpresso?5分钟搭建你的LaTeX实时编辑环境
  • 美丽寮步网站建设极致发烧:深耕本土数字化浪潮,重塑莞邑文化品牌的线上新生
  • 济南网站建设索q479185700:在数字浪潮中扎根实体经济的真实思考与避坑指南
  • Geo 优化源码上线验收标准与部署调试指南
  • AI时代中小企业的务实路线:脚踏两条船