#383 · 主分类: 计算机视觉

video-classification-3d-cnn-pytorch

action-recognition computer-vision computer-vision-tools deep-learning python pytorch video-classification

使用3D ResNet的视频分类工具

项目最后更新:11/23/18

GitHub Stars

1.1K

Forks数量

254

贡献者数量

2

许可证

MIT

收录理由

视频理解比图像分类要棘手得多,这个项目把最实际的那部分直接打包好了:预训练的3D ResNet权重,还有效果更好的ResNeXt版本,都是在Kinetics的400个动作类别上训练出来的,拿自己的视频跑推理就行,完全不用从头训练。它提供两种常见用法:score模式按每16帧给一个类别标签和置信度,适合动作识别或视频打标签;feature模式则输出512维的全局池化特征,方便接下游分类器或做检索。对研究者来说,这套代码也清晰展示了时空卷积网络的参考实现。不过要注意,它基于较早的PyTorch和CUDA环境,想在当前版本里跑起来,可能需要花点功夫做适配。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目