#91 · 主分类: 基础模型

ONE-PEACE

audio-language contrastive-loss foundation-models multimodal representation-learning vision-and-language vision-language vision-transformer

一个跨视觉、音频、语言模态的通用表示模型。论文:ONE-PEACE:探索迈向无限模态的通用表示模型。

项目最后更新:10/06/24

GitHub Stars

1.1K

Forks数量

71

贡献者数量

3

许可证

Apache-2.0

收录理由

ONE-PEACE 是一个将文本、图像和音频统一映射到同一嵌入空间的表示模型,它完全从零开始训练,没有借用任何现成的视觉或语言预训练骨干。其亮点在于零样本跨模态检索:你可以用一段音频去检索图片库,也可以把声音和文字组合起来缩小搜索范围,模型甚至能对齐训练数据中从未成对出现的模态。仓库提供了视觉、视觉-语言、音频-语言等任务的微调脚本和检查点,还附带一个视觉定位 API,能在图片中找出物体位置。对于搭建多模态搜索或检索系统的团队来说,这份预训练与评估代码值得参考;不过它属于研究级软件,使用流程需要一定熟悉度,并不是开箱即用的服务层。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目