#184 · 主分类: 计算机视觉

PointLLM

3d chatbot foundation-models gpt-4 large-language-models llama multimodal objaverse point-cloud pointllm representation-learning vision-and-language

[ECCV 2024 最佳论文候选 & TPAMI 2025] PointLLM:赋能大型语言模型理解点云

项目最后更新:05/15/26

GitHub Stars

1.1K

Forks数量

58

贡献者数量

3

许可证

Other

收录理由

PointLLM 展示了一条让大语言模型直接理解原始三维点云的新路径,而不是依赖图像输入。它将彩色物体扫描送入语言模型主干,使其既能识别物体类别,又能描述几何结构和外观,同时绕开了基于相机识别中常见的遮挡与视角依赖问题。仓库提供了完整的训练流程,包括 66 万条简单指令对和 7 万条复杂指令对,以及带权重的推理代码和用于三维物体分类、描述生成的评估脚本,还附带 Gradio 演示,方便复现 ECCV 2024 论文的结果。做具身智能、机器人或空间理解的研究者,可以把它的两阶段训练思路迁移到自己的点云数据上,但要注意训练开销较大,且环境依赖固定版本的 PyTorch 和 Transformers。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目