#21 · 主分类: 计算机视觉

OmniParser

一个简单的屏幕解析工具,面向纯视觉的GUI代理

项目最后更新:07/20/26

GitHub Stars

25.3K

Forks数量

2.2K

贡献者数量

15

许可证

Other

收录理由

纯视觉驱动的GUI智能体常卡在一个环节:模型能看懂截图,却分不清哪个像素是可点击的按钮,也猜不出图标的用途。OmniParser把原始界面截图拆解成结构化元素,给每个可交互区域标出边界框,并附上一句简短的功能描述。它用微调过的检测模型配合描述模型完成解析,输出结果可以直接喂给GPT-4V、Qwen-VL这类现成的视觉语言模型,让模型把动作准确落到屏幕坐标上。这个工具定位是组件而非完整框架,你可以把它接进自己的流程,配套的OmniTool则演示了在Windows虚拟机里跑通整套方案。对于想在桌面或移动端真实应用上做原型验证的团队,它把屏幕理解这一层做得很扎实,文档也清楚,是个不错的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目