#383 · 主分类: 计算机视觉
video-classification-3d-cnn-pytorch
action-recognition
computer-vision
computer-vision-tools
deep-learning
python
pytorch
video-classification
使用3D ResNet的视频分类工具
项目最后更新:11/23/18
GitHub Stars
1.1K
Forks数量
254
贡献者数量
2
许可证
MIT
收录理由
视频理解比图像分类要棘手得多,这个项目把最实际的那部分直接打包好了:预训练的3D ResNet权重,还有效果更好的ResNeXt版本,都是在Kinetics的400个动作类别上训练出来的,拿自己的视频跑推理就行,完全不用从头训练。它提供两种常见用法:score模式按每16帧给一个类别标签和置信度,适合动作识别或视频打标签;feature模式则输出512维的全局池化特征,方便接下游分类器或做检索。对研究者来说,这套代码也清晰展示了时空卷积网络的参考实现。不过要注意,它基于较早的PyTorch和CUDA环境,想在当前版本里跑起来,可能需要花点功夫做适配。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。