#472 · 主分类: 计算机视觉

TimeSformer-pytorch

artificial-intelligence attention-mechanism deep-learning transformers video-classification

来自Facebook AI的TimeSformer实现,一种纯基于注意力的视频分类解决方案。

项目最后更新:08/25/21

GitHub Stars

729

Forks数量

89

贡献者数量

3

许可证

MIT

收录理由

这个仓库是Facebook AI视频分类论文中Divided Space-Time Attention变体的精简实现,核心做法是先沿时间轴做注意力,再沿空间轴做注意力,这一设计让它区别于早期的视频Transformer。通过pip即可安装,使用时只需调用一个模型类,可自由调节深度、头数、patch大小和帧数,还支持帧掩码,方便处理同一批次中长度不一的视频。它属于研究型代码,不包含完整训练流程,数据加载和训练循环需要自己搭建,因此更适合用来快速验证想法、复现论文结果,或者把这种架构嵌入到更大的视频项目里。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目