从网页内部做AI操控:阿里page-agent的DOM级自动化方案
现在让 AI 帮你操作网页的工具越来越多了,自动填表、自动点按钮、自动走流程,听起来都挺美好。但真正用过就知道,这类工具大部分都有一个共同问题:慢,而且经常点错地方。
原因不复杂。目前市面上绝大多数 AI 网页操控工具的工作方式都差不多:先给网页截一张图,把图发给 AI 让它看,AI 看完以后告诉程序"点这个位置",然后程序去模拟鼠标点击。整个过程就像 AI 在隔着一层玻璃看你的屏幕,然后隔空指挥——看得不够清楚就容易点偏,页面一复杂就更容易出错。
阿里开源的 page-agent,6500+ Star,做法完全不一样。
从里面做,而不是从外面看
page-agent 不是从外面看你的网页,而是直接跑在网页里面。跑在里面意味着它不需要截图,不需要猜"这个按钮大概在屏幕什么位置"。页面上有什么按钮、有什么输入框、每个东西叫什么名字,它直接就知道。
打个比方,别的工具是闭着眼睛摸,它是睁着眼睛拿,所以速度快,准确率也高不少。
怎么用
如果只是想试试效果,往网页里加一行代码就能跑。它还有个在线 Demo,打开就能体验,不用装任何东西。
正式使用的话,一行命令安装:
npm install page-agent
模型方面,通义千问、DeepSeek 这些国产模型都能用,不需要特别贵的。
它的短板
因为它住在网页里面,所以只能操作它所在的那个页面。想让它同时操作好几个网页,得额外装一个浏览器插件,目前这个插件还比较早期。
还有一点,如果一个网页的代码写得比较乱,或者页面是用图片画出来的那种,它就不太认得了。这种情况下,反而是截图的方案更有优势。所以这两种路线各有各的适用场景。
适用场景
这个项目有趣的地方不在于功能多强,而在于它提供了一个不同的思路。大家都在想怎么从外面更好地操控浏览器,它换了个方向从里面做。在一些场景下这个方向确实更合理——比如你自己做了一个网站,想给用户加个 AI 助手帮他们自动填表、自动操作,用这个工具加几行代码就搞定了,不用搭一套复杂的后台。
它没有想着什么都干,就把"在网页内部做 AI 操控"这一件事做好。
GitHub 项目地址:https://github.com/alibaba/page-agent