#81 · 主分类: 基础模型

open_flamingo

computer-vision deep-learning flamingo in-context-learning language-model multimodal-learning pytorch

一个用于训练大型多模态模型的开源框架。

项目最后更新:08/31/24

GitHub Stars

4.1K

Forks数量

319

贡献者数量

32

许可证

MIT

收录理由

OpenFlamingo 把 DeepMind Flamingo 架构的完整 PyTorch 实现直接交到你手上,不仅有训练脚本和评估工具,还附带了预训练权重,省去了从论文复现的麻烦。它的核心思路很巧妙:保持语言模型参数冻结,只在 CLIP 视觉编码器之上加入轻量级的交叉注意力层,这样一来,你就能用自己整理的图文交错数据对现有检查点做适配,完全不必从头开始训练。对于研究少样本多模态学习的人来说,这是一个非常实用的起点;对工程师而言,想微调模型去做图像描述或视觉问答,也相当顺手。安装只需一条 pip 命令,MIT 许可证也足够宽松,拿来改、拿来用都没有顾虑。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目