#61 · 主分类: AI代理与自动化
UI-TARS-desktop
agent
agent-tars
browser-use
computer-use
cowork
gui-agent
gui-operator
mcp
mcp-server
multimodal
tars
ui-tars
vision
vlm
开源多模态AI智能体栈:连接前沿AI模型与智能体基础设施
项目最后更新:08/05/26
GitHub Stars
38.7K
Forks数量
3.9K
贡献者数量
49
许可证
Apache-2.0
收录理由
多数智能体框架只停留在文本交互,这个项目却把“看懂界面”和“动手操作”做成了核心能力。仓库里打包了一款桌面应用,将UI-TARS视觉语言模型落地为本地电脑与浏览器操作员,同时附带一套更完整的智能体栈,提供命令行和网页界面,让任务能横跨终端、浏览器和产品界面执行。它处理的是真实的图形界面工作,比如逐项点击设置、填写表单、翻页导航,靠的是视觉定位与DOM控制的结合,还能接入MCP服务器,让智能体调用外部工具。对于正在评估电脑操作自动化方案的团队来说,这是一个跨平台的起点,支持完全本地运行以照顾隐私敏感场景,需要更强算力时也可以切换到远程模型。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。