#463 · 主分类: 计算机视觉

SCAN

computer-vision cross-modal deep-learning image-captioning neural-network pytorch visual-semantic

用于图像-文本匹配的堆叠交叉注意力(ECCV 2018)的PyTorch源代码

项目最后更新:05/18/23

GitHub Stars

580

Forks数量

118

贡献者数量

4

许可证

Apache-2.0

收录理由

做跨模态检索或图像描述生成的人,多半绕不开这个仓库——它是ECCV 2018那篇提出堆叠交叉注意力网络(Stacked Cross Attention Network)的论文官方实现,专门用来对齐图像与自然语言描述。代码里训练和评估脚本都齐,还带了词汇表工具,以及论文里在MS-COCO和Flickr30K上复现结果所用的确切超参数,想基于注意力机制做图文匹配实验,不用自己从头搭架构,直接拿它当起点很顺手。实现上用了自底向上的区域特征和双向GRU文本编码器,这套组合对搭建或对比自己的检索模型很有参考价值。不过要清楚,这是研究代码,跟特定论文绑定,更适合当作基准和学习的材料,而不是能直接上生产的服务。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目