#95 · 主分类: 基础模型

Otter

artificial-inteligence chatgpt deep-learning embodied-ai foundation-models gpt-4 instruction-tuning large-scale-models machine-learning multi-modality visual-language-learning

🦦 Otter,一个基于OpenFlamingo(DeepMind Flamingo的开源版本)的多模态模型,在MIMIC-IT上训练,展示了改进的指令跟随和上下文学习能力。

项目最后更新:03/05/24

GitHub Stars

3.4K

Forks数量

210

贡献者数量

12

许可证

MIT

收录理由

对于正在开发或微调视觉-语言模型的团队,Otter提供了一个经过验证的代码库,而不是需要从头复现的论文。它延续了OpenFlamingo的Flamingo风格架构,一个模型即可处理交错的图像和文本输入,仓库中包含了预训练、指令微调和RLHF的训练脚本。OtterHD基于Fuyu-8B构建,去掉了显式的视觉编码器,直接处理高分辨率图像块,并提供了使用FlashAttention-2的微调脚本。研究者还可以使用统一的数据加载器来读取常见多模态数据集,并通过一键式工具在八个基准上运行GPT-4V评估。如果你关注混合视觉与文本输入上的上下文学习,这个项目是一个值得研究和改造的扎实基础。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目