#952 · 主分类: 教育与研究

OmniNet

artificial-intelligence deep-learning image-captioning machine-learning multimodal-learning multitask-learning neural-network nlp transformer video-recognition

OmniNet的官方Pytorch实现:“OmniNet:用于多模态多任务学习的统一架构” | 作者:Subhojeet Pramanik, Priyanka Agrawal, Aman Hussain

项目最后更新:10/31/20

GitHub Stars

514

Forks数量

59

贡献者数量

3

许可证

Apache-2.0

收录理由

这个仓库是OmniNet论文作者放出的官方PyTorch实现,代码紧凑,适合想研究怎么用单个模型同时处理文本、图像和视频多种任务的人。它把每个输入类型先经过各自的神经外围模块,再统一送进一个基于Transformer的共享处理器,正是这个共享核心让一个模型能同时完成词性标注、图像描述、视觉问答和视频活动识别。仓库里带了预训练权重和数据集下载脚本,训练命令也能复现论文里的结果,不是那种第三方凑合的移植。另外它还展示了多GPU上的异步训练方式,以及视频描述和视频问答的零样本预测实验,对教学或者深入理解多模态统一架构都挺有价值。不过要留意,这项目从2020年后就没再维护,不适合直接拿去生产环境用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目