#61 · 主分类: AI代理与自动化

UI-TARS-desktop

agent agent-tars browser-use computer-use cowork gui-agent gui-operator mcp mcp-server multimodal tars ui-tars vision vlm

开源多模态AI智能体栈:连接前沿AI模型与智能体基础设施

项目最后更新:08/05/26

GitHub Stars

38.7K

Forks数量

3.9K

贡献者数量

49

许可证

Apache-2.0

收录理由

多数智能体框架只停留在文本交互,这个项目却把“看懂界面”和“动手操作”做成了核心能力。仓库里打包了一款桌面应用,将UI-TARS视觉语言模型落地为本地电脑与浏览器操作员,同时附带一套更完整的智能体栈,提供命令行和网页界面,让任务能横跨终端、浏览器和产品界面执行。它处理的是真实的图形界面工作,比如逐项点击设置、填写表单、翻页导航,靠的是视觉定位与DOM控制的结合,还能接入MCP服务器,让智能体调用外部工具。对于正在评估电脑操作自动化方案的团队来说,这是一个跨平台的起点,支持完全本地运行以照顾隐私敏感场景,需要更强算力时也可以切换到远程模型。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目