#459 · 主分类: 计算机视觉

VisTR

cvpr2021 instance-segmentation transformers video-instance-segmentation

[CVPR2021 Oral] 使用Transformers进行端到端视频实例分割

项目最后更新:07/15/21

GitHub Stars

758

Forks数量

97

贡献者数量

2

许可证

Apache-2.0

收录理由

VisTR 是 CVPR 2021 口头报告论文的官方代码,它把视频实例分割做成了一次性的端到端流程。传统做法通常先逐帧检测目标,再在时间轴上串联结果,而 VisTR 直接让整个视频片段通过 Transformer,一次性输出一组实例序列,省去了大量手工设计的后处理步骤。如果你熟悉 DETR 风格的目标查询机制,这套设计会很容易上手。仓库里提供了训练和推理脚本、预训练权重以及 YouTubeVIS 数据集的配置说明,照着走就能复现论文中的指标。不过要注意,训练时显存需求很高,作者用的是 32GB 的 V100,所以它更适合有充足计算资源的团队,而不是想在笔记本上快速跑通实验的人。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目