#1059 · 主分类: AI代理与自动化
AI-Employe
使用GPT-4 Vision,像教人类一样进行浏览器自动化。
项目最后更新:02/19/24
GitHub Stars
585
Forks数量
54
贡献者数量
1
许可证
AGPL-3.0
收录理由
这个项目把浏览器自动化带到了另一个思路上:你不需要手写选择器和等待条件,只要用自然语言描述任务,GPT-4 Vision 就会通过浏览器扩展和 Rust 后端来执行点击和输入。它最值得借鉴的地方在于绕开了视觉智能体常见的“猜坐标”问题——系统先把页面的 DOM 索引到 MeiliSearch 里,让模型根据可见文本来定位元素,从而减少幻觉操作。同时,它还会观察你在演示工作流时对 DOM 做的改动,把这些操作反馈到提示词中,防止模型中途跑偏。对于想自己搭建浏览器智能体或尝试 RPA 风格自动化的团队来说,这是一个很好的参考实现。不过要跑起来,你需要自己配置 Firebase、Postgres 和 MeiliSearch 这些依赖。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。