#342 · 主分类: 计算机视觉

flamingo-pytorch

artificial-intelligence attention-mechanism deep-learning transformers visual-question-answering

在Pytorch中实现🦩 Flamingo,Deepmind的最先进的小样本视觉问答注意力网络。

项目最后更新:10/18/22

GitHub Stars

1.3K

Forks数量

66

贡献者数量

2

许可证

MIT

收录理由

想尝试视觉语言模型的研究者和工程师,会发现这个仓库是把DeepMind的Flamingo架构用PyTorch重新实现的好帮手。它没有做成单一的整体模型,而是拆成了两个部分:感知器重采样器负责把较长的媒体序列压缩成一组可学习的隐变量,带门控的交叉注意力块则让语言模型在指定位置关注这些图像。项目还给出了一个完整示例,用ViT编码器搭配类似PaLM的主干,并演示了如何只训练重采样器和交叉注意力部分、冻结其余参数。这为研究少样本视觉问答或扩展该架构提供了一个实用的出发点,不过交付的是可组合的构建模块,而非开箱即用的应用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目