#59 · 主分类: 机器人仿真与具身智能模拟

RT-2

artificial-intelligence attention-mechanism embodied-agent gpt4 multi-modal robotics transformer

RT-2的民主化:“RT-2:新模型将视觉和语言转化为行动”

项目最后更新:07/26/24

GitHub Stars

584

Forks数量

68

贡献者数量

2

许可证

MIT

收录理由

RT-2 是一个紧凑的 PyTorch 重实现,对应谷歌提出的视觉-语言-动作模型,代码量小到可以通读,也方便按需改动。它把 PaLM-E 风格的语言主干和视觉编码器组合在一起,让摄像头图像和文本指令进入同一个嵌入空间,模型最终输出机器人能直接执行的动作标记。对于想弄明白网络规模预训练如何迁移到机器人操作的人来说,这份代码比单看论文更容易上手。项目支持 pip 安装,暴露了一个整合视觉与语言组件的 RT2 类,还附带了喂入图像和文字说明的简单示例。它更适合作为研究和原型验证的参考,而不是生产级的控制方案;真正落地仍需要原始工作里提到的机器人数据管道和硬件集成。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目