bot.sannysoft.com全绿通过之后:5万token的网页被压到2000,抓取成本砍到二十五分之一
让Agent操作浏览器听上去容易,实际做起来全是坑:反爬拦截、Token爆炸、经验不能积累,这三个问题像三座大山。
BrowserAct 用三层结构把这些问题都解决了,在GitHub上已获得2900多个Star。它是一套专门给Agent用的浏览器自动化工具——以前在Agent上加一层Playwright勉强能用,但那两个框架不是为Agent设计的,真实网络上反爬机制一上去就被拦截,原始HTML动不动几万个Token,换个网站又要重新摸索DOM结构。
三层架构
第一层:环境层——让Agent看起来像真人
使用stealth反检测浏览器、指纹伪装、动态代理、session/cookie/profile隔离等方法,让Agent看起来更像普通用户而非自动化脚本。比如让Agent在亚马逊搜索"无线鼠标",它会启动stealth浏览器并用普通用户指纹伪装自己,绕过反爬虫检测。网站看到的是"一台Windows机器上的正常请求",而不是"自动化脚本在访问"。
它还会到 bot.sannysoft.com 做反检测测试,结果全部绿色通过。
第二层:执行层——一条命令完成工作
环境层解决"进去"的问题,执行层解决"拿出来"的问题。Agent不用自己处理"怎么绕过反爬",直接用标准命令控制浏览器:点击第三个交互元素、在第二个输入框填入内容、用stealth-extract提取被保护网页的内容。
返回的不是原始HTML,而是结构化数据,可以把商品名称、价格、店铺、销量等信息直接保存。即使亚马逊反爬严格,BrowserAct也能正常访问并提取数据,连Prime配送信息都能正确抓取。
第三层:人机交互层——卡住时让人接手
Agent遇到需要登录验证等情况时会自动暂停,生成一个远程链接让人接手。比如查看亚马逊卖家后台数据需要登录,Agent打开页面发现需要登录就暂停并生成链接,用户点击完成登录后,Agent获得登录状态继续获取数据。
Token成本对比
官方数据:原始HTML约5万个token,过滤后只剩2000多个,减少90%以上。抓取Amazon Electronics Bestsellers前80条数据,总用时2分14秒,成本对比明显:Playwright MCP花费1.75美元,BrowserAct仅0.07美元。
三种浏览器模式
- Chrome模式:复用本地Chrome的登录信息,不必重复输入用户名密码
- Stealth隐私模式:每次产生新的浏览器指纹和代理IP,相当于新用户访问
- 保密固定身份模式:固定指纹和IP,每个浏览器环境产生长久稳定、独一无二的身份,适合多账号运营
Skill Forge:自动生成可复用Skill
Skill Forge可以根据需求自动生成Skill。比如要"提取亚马逊鼠标排行榜前10名商品",不需要研究网页结构或写脚本,只需用自然语言说出需求,它会自动分析方案(DOM API、页面操作等)并生成相应Skill,最后进行测试验证。项目中已预制70多个技能,包括Amazon、淘宝、闲鱼等平台。
Skill Forge地址:https://github.com/browser-act/skills/tree/main/browser-act-skill-forge
安装方式
在Claude Code中输入:
请帮我安装 BrowserAct Skill: https://github.com/browser-act/skills/tree/main/browser-act
Claude Code会自动完成安装并验证功能。
注意事项
大多数功能免费,只有需要用到代理时才需要付费。项目基于 MIT 协议开源。
开源地址:https://github.com/browser-act/skills
官网:https://www.browseract.ai/kyrj