#411 · 主分类: 计算机视觉

actionformer_release

action-localization computer-vision deeplearning eccv2022 video-analysis vision-transformer

ActionFormer(ECCV 2022)的代码发布

项目最后更新:04/11/24

GitHub Stars

573

Forks数量

95

贡献者数量

3

许可证

MIT

收录理由

ActionFormer 是较早把 Transformer 架构引入时序动作定位任务的模型之一,这个仓库正是其 ECCV 2022 论文的官方参考实现。它能在未裁剪视频中一次性判断动作的起止时刻并识别动作类别,无需候选片段生成,也不用预设锚点窗口。仓库自带 THUMOS14、ActivityNet 1.3 和 EPIC-Kitchens 100 的训练与评估代码,包含配置、数据加载器和预训练权重,论文里的结果可以直接复现,省去逆向工程配置的麻烦。此外,该模型还是 Ego4D 时刻查询挑战赛中许多优胜方案的基础,做时刻定位或视频定位相关工作的人可以拿它当实用起点。代码风格干净,受 Detectron2 启发,研究时序动作定位的同行或搭建视频理解系统的团队,上手改造都比较顺手。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目