#94 · 主分类: 基础模型
OFA
chinese
image-captioning
multimodal
pretrained-models
pretraining
prompt
prompt-tuning
referring-expression-comprehension
text-to-image-synthesis
vision-language
visual-question-answering
OFA官方仓库(ICML 2022)。论文:OFA:通过简单的序列到序列学习框架统一架构、任务和模态
项目最后更新:04/24/24
GitHub Stars
2.6K
Forks数量
248
贡献者数量
12
许可证
Apache-2.0
收录理由
OFA 用一个统一的序列到序列骨干网络,把看图说话、视觉问答、指代定位、文生图这些常见的视觉语言任务收进同一套模型,不必为每个任务单独搭一个网络,一个权重文件就能应对多种场景。它同时提供了英文和中文的预训练与微调权重,还附带了从零预训练和在自己的数据上做适配的分步说明,照着走就能比较轻松地复现论文里的结果。ICML 2022 的论文把这种统一思路讲得很清楚,Hugging Face 集成也让接入现有流程变得顺手。如果想让团队在众多多模态方案里挑一个作为通用基础,而不是维护一堆任务专属模型,这个项目文档扎实、用起来也直接。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。