Tsaagan:面向 AI 智能体的浏览器操作工具,强调动作可验证
开发者发布开源工具 Tsaagan,让 AI 智能体像人一样驱动浏览器完成登录、表单填写等任务,并验证每一步执行结果。
Show HN 上线的新项目 Tsaagan 是一款面向 AI 智能体的浏览器控制工具,由开发者 Michael Olmos 开源发布。其核心理念是把智能体(agent)定位为「大脑」,把浏览器交互交给 Tsaagan 这双「手」,让 Claude、Codex、Cursor 等任意模型驱动的智能体能够在真实浏览器中完成登录、点击、表单填写、抓取登录后数据等任务,并逐步验证动作结果。
核心思路:感知 → 行动 → 验证 → 记忆
Tsaagan 在执行机制上强调「先观察后出手」。它读取页面的可访问性树(accessibility tree)来定位元素,执行操作后通过真实页面状态判断动作是否真的成功,包括 URL 是否改变、是否出现预期文本、是否报错等,而不是发出指令后盲目推进。项目作者认为,这一步验证是「自动化勉强能用」与「无人值守可信自动化」之间的关键差异。
工具内置分层能力调用策略,按从轻到重的顺序选择执行通道:
- 优先调用目标站点的官方 API(密钥保存在操作系统 Keychain 中,速度与可靠性最高);
- 其次通过浏览器扩展(跨平台)或 macOS 原生通道驱动真实 Chrome,使用受信输入(trusted input),避免被站点识别为自动化流量;
- 最后回退到基于 Playwright 的 CDP 通道,覆盖无 API 的中长尾网站。
记忆与学习机制
Tsaagan 不只是记录状态,而是建立一套学习回路:每次运行成功后保存为可复用流程;失败则通过 LLM 反思生成一行经验教训;遇到反爬风控时自动将该域名切换为「人类节奏」模式。积累的零散经验会被进一步综合成长期规则,供后续任务调用。所有数据保存在本地文件,敏感信息仅存于系统 Keychain。
边界与使用约束
项目作者在文档中明确划定了 Tsaagan 不做的事:不破解验证码、不规避平台封禁、不违反目标站点服务条款;遇到验证码或反滥用拦截时会停下来把控制权交回给人类;对购买、发送、删除等不可逆操作要求人类确认。其使用边界由项目内的 SOUL.md 与 AGENTS.md 文件约束,并要求用户只对自己拥有或被授权的账号与系统进行自动化。
在拥挤赛道中的位置
浏览器控制类智能体工具并不稀缺,OpenAI 的 Operator、Anthropic 的 computer use、开源项目 Browser Use 等都已切入类似场景。Tsaagan 的差异化卖点集中在「每一步都验证」「本地优先、按最轻通道调用」「经验沉淀为规则」三点。但项目目前缺少公开的 benchmark、性能数据或可对比的准确率指标,README 中更多是理念描述而非量化结果,对开发者评估其相对于现有方案的优劣帮助有限。
