#342 · 主分类: 计算机视觉
flamingo-pytorch
artificial-intelligence
attention-mechanism
deep-learning
transformers
visual-question-answering
在Pytorch中实现🦩 Flamingo,Deepmind的最先进的小样本视觉问答注意力网络。
项目最后更新:10/18/22
GitHub Stars
1.3K
Forks数量
66
贡献者数量
2
许可证
MIT
收录理由
想尝试视觉语言模型的研究者和工程师,会发现这个仓库是把DeepMind的Flamingo架构用PyTorch重新实现的好帮手。它没有做成单一的整体模型,而是拆成了两个部分:感知器重采样器负责把较长的媒体序列压缩成一组可学习的隐变量,带门控的交叉注意力块则让语言模型在指定位置关注这些图像。项目还给出了一个完整示例,用ViT编码器搭配类似PaLM的主干,并演示了如何只训练重采样器和交叉注意力部分、冻结其余参数。这为研究少样本视觉问答或扩展该架构提供了一个实用的出发点,不过交付的是可组合的构建模块,而非开箱即用的应用。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。