#309 · 主分类: 计算机视觉

VoxFormer

2d-to-3d 3d-perception 3d-scene-understanding artificial-intelligence autonomous-driving autonomous-vehicles computer-vision deep-learning machine-learning occupancy-grid-map semantic-scene-completion semantickitti vision-transformer voxel-proceessing

VoxFormer [CVPR 2023 Highlight] 的官方 PyTorch 实现

项目最后更新:12/07/23

GitHub Stars

1.2K

Forks数量

102

贡献者数量

3

许可证

Other

收录理由

VoxFormer 解决的是一个颇具挑战性的三维感知问题:仅凭普通摄像头拍摄的二维图像,就能重建出完整且带有语义标签的三维体素场景,连被遮挡和不可见的区域也能一并补全。它的做法分两步走——先从单目深度估计中提出稀疏的体素查询,再用自注意力机制将其稠密化,这样既能把训练时的 GPU 显存控制在 16GB 以内,又能在 SemanticKITTI 场景补全榜单上保持有竞争力的成绩。对于在无法依赖激光雷达的场景下做纯视觉占据网格预测的研究者或工程师来说,这套代码是一个很实在的参照。仓库里提供了完整的训练与评估流程、预训练权重,还附带了可变形注意力模块的变体,照着跑出论文里的指标或者把架构改到自己的数据上都不费劲。需要留意的是,NVIDIA 的非商业许可协议意味着它更适合做研究探索,不适合直接拿来商用发布。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目