#39 · 主分类: 机器人仿真与具身智能模拟
DriveLM
autonomous-driving
chain-of-thought
graph-of-thoughts
large-language-models
llm
prompt-engineering
prompting
tree-of-thoughts
vision-language
[ECCV 2024 Oral] DriveLM: 驾驶中的图视觉问答
项目最后更新:07/02/25
GitHub Stars
1.3K
Forks数量
88
贡献者数量
15
许可证
Apache-2.0
收录理由
如果你正在为自动驾驶打造视觉语言模型,DriveLM值得一看。它把基于nuScenes和CARLA模拟器构建的图结构视觉问答数据集,与一个既能回答这些问题、又能输出驾驶决策的基线VLM智能体打包在一起——一个仓库里同时拿到基准和起步模型,省去不少折腾。这里的推理被拆成感知、预测、规划、行为等一系列问题,而不是直接给一个端到端的结果,更像人类开车时的思考过程。由于该项目曾支撑起官方自动驾驶挑战赛的一个赛道,评估流程经过大量实战检验,文档也写得清楚。想测试大视觉语言模型在结构化、场景化驾驶任务上的表现,这里是个实在的试验场。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。