#94 · 主分类: 基础模型

OFA

chinese image-captioning multimodal pretrained-models pretraining prompt prompt-tuning referring-expression-comprehension text-to-image-synthesis vision-language visual-question-answering

OFA官方仓库(ICML 2022)。论文:OFA:通过简单的序列到序列学习框架统一架构、任务和模态

项目最后更新:04/24/24

GitHub Stars

2.6K

Forks数量

248

贡献者数量

12

许可证

Apache-2.0

收录理由

OFA 用一个统一的序列到序列骨干网络,把看图说话、视觉问答、指代定位、文生图这些常见的视觉语言任务收进同一套模型,不必为每个任务单独搭一个网络,一个权重文件就能应对多种场景。它同时提供了英文和中文的预训练与微调权重,还附带了从零预训练和在自己的数据上做适配的分步说明,照着走就能比较轻松地复现论文里的结果。ICML 2022 的论文把这种统一思路讲得很清楚,Hugging Face 集成也让接入现有流程变得顺手。如果想让团队在众多多模态方案里挑一个作为通用基础,而不是维护一堆任务专属模型,这个项目文档扎实、用起来也直接。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目