#39 · 主分类: 机器人仿真与具身智能模拟

DriveLM

autonomous-driving chain-of-thought graph-of-thoughts large-language-models llm prompt-engineering prompting tree-of-thoughts vision-language

[ECCV 2024 Oral] DriveLM: 驾驶中的图视觉问答

项目最后更新:07/02/25

GitHub Stars

1.3K

Forks数量

88

贡献者数量

15

许可证

Apache-2.0

收录理由

如果你正在为自动驾驶打造视觉语言模型,DriveLM值得一看。它把基于nuScenes和CARLA模拟器构建的图结构视觉问答数据集,与一个既能回答这些问题、又能输出驾驶决策的基线VLM智能体打包在一起——一个仓库里同时拿到基准和起步模型,省去不少折腾。这里的推理被拆成感知、预测、规划、行为等一系列问题,而不是直接给一个端到端的结果,更像人类开车时的思考过程。由于该项目曾支撑起官方自动驾驶挑战赛的一个赛道,评估流程经过大量实战检验,文档也写得清楚。想测试大视觉语言模型在结构化、场景化驾驶任务上的表现,这里是个实在的试验场。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目