#103 · 主分类: 基础模型

MetaTransformer

artificial-intelligence computer-vision foundationmodel machine-learning multimedia multimodal transformers

Meta-Transformer:用于统一多模态学习

项目最后更新:12/05/23

GitHub Stars

1.6K

Forks数量

116

贡献者数量

5

许可证

Apache-2.0

收录理由

多模态研究里有个反复出现的问题:同一个Transformer主干能否同时处理多种输入?这个项目给出的答案是,一个权重冻结的编码器就能覆盖图像、文本、点云、音频、时间序列乃至IMU传感器数据等十二种模态,做法是先把每种原始输入映射到一个共享的token空间。这种设计与常见的“每种模态配一个编码器”的思路很不一样,它展示了一个视觉预训练主干如何迁移到其他领域,而且不依赖成对的多模态训练数据。代码按tokenizer、共享编码器和任务特定头来组织,想把它改到自己的基准上并不难。与其说这是一个开箱即用的应用,不如把它看作统一多模态感知的研究蓝图。对于研究跨模态特征共享的团队来说,这份代码提供了一个清晰且可验证的参照。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目