工具
BrowserAct:面向 AI Agent 的浏览器自动化工具开源
BrowserAct 是一款面向 AI Agent 的浏览器自动化 CLI,主打开源与反检测,支持多 Agent 并发与…
2026.07.28 · 周二约 3 分钟阅读
BrowserAct 是一款面向 AI Agent 的浏览器自动化命令行工具,主打开源、免登录即可使用大部分功能,已支持 Claude Code、Cursor、VS Code、OpenCode、Codex、Gemini CLI 等主流 Agent 框架,覆盖 Windows、macOS 与 Linux。其核心目标是解决现有浏览器工具在反检测、多账号隔离、人机协作与 Agent 推理兼容性上的不足。
三层反检测与人机接管
BrowserAct 提供三层渐进式反检测能力:
- 环境层:通过浏览器指纹伪装、TLS 指纹轮换与代理切换规避常规检测,多数拦截根本不会触发。
- 执行层:solve-captcha 自动处理验证码;stealth-extract 一条命令即可拉取受保护页面内容。
- 人机层:remote-assist 生成实时链接,用户从任意设备接管浏览器,任务完成后 Agent 无缝继续执行。
三种浏览器模式按场景切换
- chrome:复用本地 Chrome 登录态,支持 Profile 导入或 CDP 连接,适合需要延续现有账号会话的场景。
- stealth privacy mode:每次会话使用全新指纹并轮换代理,零残留,适合无需登录的批量抓取。
- stealth fixed identity:稳定指纹 + 稳定 IP,支持多浏览器并行,适合多账号任务且不被风控标记。
为 Agent 而非人类脚本设计
- 紧凑文本输出:采用索引化文本格式,相比 JSON 或 HTML 更省 Token。
- 索引化交互:状态以索引列表返回(如 click 3 / input 2「…」),无需解析 DOM。
- 语义记忆:每个浏览器自带语义描述(desc),按任务语义进行匹配。
- 并发安全:会话所有权 + 显式命名机制,确保多 Agent 操作互不冲突。
在安全方面,浏览器创建/删除、Profile 导入、代理变更等敏感操作必须经用户逐次显式确认,权限不跨会话保留,并在 Skill 层强制执行而非依赖配置开关。
兼容性与免费策略
BrowserAct 可与任何能执行 shell 命令并加载 Skills 的 Agent 配合使用。绝大多数功能免费开放:
- 无需登录即可使用:浏览器自动化(Chrome / Chrome-direct)。
- 登录后解锁:隐身浏览器(≤5 个)、stealth-extract、solve-captcha、remote-assist、隐私模式与 Skill Forge。
- 付费项目:托管代理(动态/静态)以及超过 5 个隐身浏览器。
生态:Skill Forge 与 Solutions Catalog
项目同时推出 Skill Forge:让 Agent 探索一次目标站点,自动发现其 API 与数据结构,生成可部署的 Skill 包,后续无需重复探索即可稳定运行,适合 500 到 5,000 条级别的批量抓取。此外还提供 Solutions Catalog,已收录 30+ 预生成 Skill,覆盖 Amazon、Google Maps、YouTube、Reddit、微信、知乎等平台,开发者也可基于任意站点自定义生成 Skill,无需手写爬虫。
