#472 · 主分类: 计算机视觉
TimeSformer-pytorch
artificial-intelligence
attention-mechanism
deep-learning
transformers
video-classification
来自Facebook AI的TimeSformer实现,一种纯基于注意力的视频分类解决方案。
项目最后更新:08/25/21
GitHub Stars
729
Forks数量
89
贡献者数量
3
许可证
MIT
收录理由
这个仓库是Facebook AI视频分类论文中Divided Space-Time Attention变体的精简实现,核心做法是先沿时间轴做注意力,再沿空间轴做注意力,这一设计让它区别于早期的视频Transformer。通过pip即可安装,使用时只需调用一个模型类,可自由调节深度、头数、patch大小和帧数,还支持帧掩码,方便处理同一批次中长度不一的视频。它属于研究型代码,不包含完整训练流程,数据加载和训练循环需要自己搭建,因此更适合用来快速验证想法、复现论文结果,或者把这种架构嵌入到更大的视频项目里。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。