#469 · 主分类: 计算机视觉
Transformer-MM-Explainability
[ICCV 2021-口头报告] 用于解释双模态和编码器-解码器Transformer的通用注意力模型可解释性的官方PyTorch实现,一种可视化任意基于Transformer网络的新方法。包含DETR、VQA示例。
项目最后更新:08/24/23
GitHub Stars
913
Forks数量
116
贡献者数量
4
许可证
MIT
收录理由
调试一个需要处理图像的Transformer模型时,无论是做目标检测、视觉问答,还是CLIP式的零样本任务,能直观看到模型实际关注的区域会很有帮助。这个仓库是ICCV 2021官方PyTorch实现,对应论文提出的Generic Attention-model Explainability方法,它能把注意力头和层转化成输入图像上的热力图。仓库里带有DETR、LXMERT/VQA、CLIP和ViT的可运行notebook示例,你可以直接换用自己准备的图片,有时还能附上自由形式的问题,不必从零搭建演示环境。因为方法本身不依赖特定网络结构,代码也能作为参考,帮你为自己训练的其他Transformer模型添加基于注意力的解释功能。不过要调整好预期:这是一套研究性质的脚本和notebook集合,并非持续维护的库,适合作为起点来使用,不适合直接部署到生产环境。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。