#91 · 主分类: 基础模型
ONE-PEACE
audio-language
contrastive-loss
foundation-models
multimodal
representation-learning
vision-and-language
vision-language
vision-transformer
一个跨视觉、音频、语言模态的通用表示模型。论文:ONE-PEACE:探索迈向无限模态的通用表示模型。
项目最后更新:10/06/24
GitHub Stars
1.1K
Forks数量
71
贡献者数量
3
许可证
Apache-2.0
收录理由
ONE-PEACE 是一个将文本、图像和音频统一映射到同一嵌入空间的表示模型,它完全从零开始训练,没有借用任何现成的视觉或语言预训练骨干。其亮点在于零样本跨模态检索:你可以用一段音频去检索图片库,也可以把声音和文字组合起来缩小搜索范围,模型甚至能对齐训练数据中从未成对出现的模态。仓库提供了视觉、视觉-语言、音频-语言等任务的微调脚本和检查点,还附带一个视觉定位 API,能在图片中找出物体位置。对于搭建多模态搜索或检索系统的团队来说,这份预训练与评估代码值得参考;不过它属于研究级软件,使用流程需要一定熟悉度,并不是开箱即用的服务层。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。