#463 · 主分类: 计算机视觉
SCAN
用于图像-文本匹配的堆叠交叉注意力(ECCV 2018)的PyTorch源代码
项目最后更新:05/18/23
GitHub Stars
580
Forks数量
118
贡献者数量
4
许可证
Apache-2.0
收录理由
做跨模态检索或图像描述生成的人,多半绕不开这个仓库——它是ECCV 2018那篇提出堆叠交叉注意力网络(Stacked Cross Attention Network)的论文官方实现,专门用来对齐图像与自然语言描述。代码里训练和评估脚本都齐,还带了词汇表工具,以及论文里在MS-COCO和Flickr30K上复现结果所用的确切超参数,想基于注意力机制做图文匹配实验,不用自己从头搭架构,直接拿它当起点很顺手。实现上用了自底向上的区域特征和双向GRU文本编码器,这套组合对搭建或对比自己的检索模型很有参考价值。不过要清楚,这是研究代码,跟特定论文绑定,更适合当作基准和学习的材料,而不是能直接上生产的服务。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。