#69 · 主分类: 深度学习框架
mmf
captioning
deep-learning
dialog
hateful-memes
multi-tasking
multimodal
pretrained-models
pytorch
textvqa
vqa
来自Facebook AI Research (FAIR)的视觉与语言多模态研究的模块化框架。
项目最后更新:07/07/26
GitHub Stars
5.6K
Forks数量
938
贡献者数量
131
许可证
Other
收录理由
刚踏入视觉与语言多模态研究的人,常常在环境搭建上耗费数天,还没开始验证想法就精疲力竭。MMF 来自 Facebook AI Research,正是为砍掉这些重复劳动而设计。它提供了视觉问答、图像描述、仇恨表情包检测等任务的模块化组件,还内置了多种领先模型的参考实现,你可以在其上微调,不必从零训练。VQA、TextVQA、TextCaps 等常用基准的数据加载器开箱即用,分布式训练也由框架代劳,研究者可以把精力放在模型构思而非基础设施上。它曾作为多个 VQA 类挑战赛的起点代码库,参赛者与启动新多模态项目的团队,都会从中节省大量时间。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。