#1059 · 主分类: AI代理与自动化

AI-Employe

automation automation-testing gpt-4 multimodal productivity rpa

使用GPT-4 Vision,像教人类一样进行浏览器自动化。

项目最后更新:02/19/24

GitHub Stars

585

Forks数量

54

贡献者数量

1

许可证

AGPL-3.0

收录理由

这个项目把浏览器自动化带到了另一个思路上:你不需要手写选择器和等待条件,只要用自然语言描述任务,GPT-4 Vision 就会通过浏览器扩展和 Rust 后端来执行点击和输入。它最值得借鉴的地方在于绕开了视觉智能体常见的“猜坐标”问题——系统先把页面的 DOM 索引到 MeiliSearch 里,让模型根据可见文本来定位元素,从而减少幻觉操作。同时,它还会观察你在演示工作流时对 DOM 做的改动,把这些操作反馈到提示词中,防止模型中途跑偏。对于想自己搭建浏览器智能体或尝试 RPA 风格自动化的团队来说,这是一个很好的参考实现。不过要跑起来,你需要自己配置 Firebase、Postgres 和 MeiliSearch 这些依赖。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目