#185 · 主分类: 计算机视觉
ViTPose
[NeurIPS'22]《ViTPose:用于人体姿态估计的简单视觉Transformer基线》和[TPAMI'23]《ViTPose++:用于通用身体姿态估计的视觉Transformer》的官方仓库。
项目最后更新:12/25/25
GitHub Stars
2.1K
Forks数量
268
贡献者数量
4
许可证
Apache-2.0
收录理由
ViTPose 是 NeurIPS 2022 论文的官方实现,专注于用视觉 Transformer 做人体姿态估计。仓库里不仅提供了论文代码,还附带多种尺寸的预训练权重、训练和推理配置,并且和 MMPose 生态打通,省去从零搭建的麻烦,能直接上手做关键点检测。后续的 ViTPose++ 把同一套骨干网络扩展到通用身体姿态估计,在多个数据集上都有验证,适合需要跨数据集迁移的场景,不用为每个数据集单独调模型。它在 MS COCO 关键点测试集上达到 81.1 AP,还提供了图片和视频的 Hugging Face 在线演示,无论是做研究对比还是给应用接入关键点识别,都是很扎实的基础。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。