GitHub Stars
25.3K
Forks数量
2.2K
贡献者数量
15
许可证
Other
收录理由
纯视觉驱动的GUI智能体常卡在一个环节:模型能看懂截图,却分不清哪个像素是可点击的按钮,也猜不出图标的用途。OmniParser把原始界面截图拆解成结构化元素,给每个可交互区域标出边界框,并附上一句简短的功能描述。它用微调过的检测模型配合描述模型完成解析,输出结果可以直接喂给GPT-4V、Qwen-VL这类现成的视觉语言模型,让模型把动作准确落到屏幕坐标上。这个工具定位是组件而非完整框架,你可以把它接进自己的流程,配套的OmniTool则演示了在Windows虚拟机里跑通整套方案。对于想在桌面或移动端真实应用上做原型验证的团队,它把屏幕理解这一层做得很扎实,文档也清楚,是个不错的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。