#184 · 主分类: 计算机视觉
PointLLM
[ECCV 2024 最佳论文候选 & TPAMI 2025] PointLLM:赋能大型语言模型理解点云
项目最后更新:05/15/26
GitHub Stars
1.1K
Forks数量
58
贡献者数量
3
许可证
Other
收录理由
PointLLM 展示了一条让大语言模型直接理解原始三维点云的新路径,而不是依赖图像输入。它将彩色物体扫描送入语言模型主干,使其既能识别物体类别,又能描述几何结构和外观,同时绕开了基于相机识别中常见的遮挡与视角依赖问题。仓库提供了完整的训练流程,包括 66 万条简单指令对和 7 万条复杂指令对,以及带权重的推理代码和用于三维物体分类、描述生成的评估脚本,还附带 Gradio 演示,方便复现 ECCV 2024 论文的结果。做具身智能、机器人或空间理解的研究者,可以把它的两阶段训练思路迁移到自己的点云数据上,但要注意训练开销较大,且环境依赖固定版本的 PyTorch 和 Transformers。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。