#69 · 主分类: 深度学习框架

mmf

captioning deep-learning dialog hateful-memes multi-tasking multimodal pretrained-models pytorch textvqa vqa

来自Facebook AI Research (FAIR)的视觉与语言多模态研究的模块化框架。

项目最后更新:07/07/26

GitHub Stars

5.6K

Forks数量

938

贡献者数量

131

许可证

Other

收录理由

刚踏入视觉与语言多模态研究的人,常常在环境搭建上耗费数天,还没开始验证想法就精疲力竭。MMF 来自 Facebook AI Research,正是为砍掉这些重复劳动而设计。它提供了视觉问答、图像描述、仇恨表情包检测等任务的模块化组件,还内置了多种领先模型的参考实现,你可以在其上微调,不必从零训练。VQA、TextVQA、TextCaps 等常用基准的数据加载器开箱即用,分布式训练也由框架代劳,研究者可以把精力放在模型构思而非基础设施上。它曾作为多个 VQA 类挑战赛的起点代码库,参赛者与启动新多模态项目的团队,都会从中节省大量时间。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目