#59 · 主分类: 机器人仿真与具身智能模拟
RT-2
artificial-intelligence
attention-mechanism
embodied-agent
gpt4
multi-modal
robotics
transformer
RT-2的民主化:“RT-2:新模型将视觉和语言转化为行动”
项目最后更新:07/26/24
GitHub Stars
584
Forks数量
68
贡献者数量
2
许可证
MIT
收录理由
RT-2 是一个紧凑的 PyTorch 重实现,对应谷歌提出的视觉-语言-动作模型,代码量小到可以通读,也方便按需改动。它把 PaLM-E 风格的语言主干和视觉编码器组合在一起,让摄像头图像和文本指令进入同一个嵌入空间,模型最终输出机器人能直接执行的动作标记。对于想弄明白网络规模预训练如何迁移到机器人操作的人来说,这份代码比单看论文更容易上手。项目支持 pip 安装,暴露了一个整合视觉与语言组件的 RT2 类,还附带了喂入图像和文字说明的简单示例。它更适合作为研究和原型验证的参考,而不是生产级的控制方案;真正落地仍需要原始工作里提到的机器人数据管道和硬件集成。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。