#459 · 主分类: 计算机视觉
VisTR
[CVPR2021 Oral] 使用Transformers进行端到端视频实例分割
项目最后更新:07/15/21
GitHub Stars
758
Forks数量
97
贡献者数量
2
许可证
Apache-2.0
收录理由
VisTR 是 CVPR 2021 口头报告论文的官方代码,它把视频实例分割做成了一次性的端到端流程。传统做法通常先逐帧检测目标,再在时间轴上串联结果,而 VisTR 直接让整个视频片段通过 Transformer,一次性输出一组实例序列,省去了大量手工设计的后处理步骤。如果你熟悉 DETR 风格的目标查询机制,这套设计会很容易上手。仓库里提供了训练和推理脚本、预训练权重以及 YouTubeVIS 数据集的配置说明,照着走就能复现论文中的指标。不过要注意,训练时显存需求很高,作者用的是 32GB 的 V100,所以它更适合有充足计算资源的团队,而不是想在笔记本上快速跑通实验的人。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。