
但当Agent真正进入淘宝、闲鱼和小红书,它面对的环境和读取本地文件完全不同。
尤其是需要登录才能看的,Agent靠自己的能力肯定是做不了。
所以,Agent需要一个真正适合它使用的浏览器,让它稳定地进入网站,把任务继续做下去。
这个工具能够理解页面、管理登录状态、隔离不同任务、处理异常等等。
今天看到一个高星项目,反爬机制做的很好。

对于需要重复运行的网站任务,它还可以通过Skill Forge,把一次成功的网站探索过程生成可反复使用的 Skill。
DEMO
总共有78个skill,对应了78个不同的场景。
随便贴出来一部分,需要什么skill就让Agent帮你下载什么skill。

先简单测试下。
让Agent打开Wikipedia首页,并用自然语言搜索一个问题。BrowserAct找到了搜索框和搜索按钮,完成输入和页面跳转,获得中文维基百科的搜索结果。

这项能力对数据采集尤其重要,因为网页上看到的内容往往来自后台接口,如果Agent能在浏览过程中找到相对稳定的数据来源,后续任务就不需要一直从复杂页面中提取文字,执行效率和稳定性都会更高。
这也是Skill Forge的路径,在探索网站时会优先寻找合适的数据接口,如果没有稳定接口,再回退到页面元素操作。一次成功后,业务中的关键词、页数、地区或价格区间可以变成可调整的输入,后续任务则沿用已经验证过的路径。
然后安装测试了项目里的淘宝关键词搜索Skill。
BrowserAct成功打开了淘宝首页,也能读取首页中公开展示的商品、价格和频道信息。
不过这场景还是需要登录下账号的。

在需要登录的情况下,用户不用把账号密码直接给 Agent,BrowserAct提供了人工接管能力,Agent可以在当前页面暂停,并生成一个供用户控制浏览器的链接。
用户完成扫码或验证后,再把当前会话交还给Agent,让它从原来的位置继续工作。
https://github.com/browser-act/skills
© 版权声明
文章版权归作者所有,未经允许请勿转载。
