#48 · 主分类: 基础模型

perception_models

最先进的图像与视频CLIP、多模态大语言模型等!

项目最后更新:04/13/26

GitHub Stars

2.4K

Forks数量

160

贡献者数量

14

许可证

Apache-2.0

收录理由

Meta 的最新感知研究成果都汇集在这个代码库里:Perception Encoder 是一个 CLIP 风格的模型系列,能把图像、视频和音频映射到同一向量空间,在零样本分类、检索和稠密预测等任务上表现亮眼;配套的 Perception Language Model 则是一个多模态解码器,负责把这些向量转成自然语言,直接用于问答场景。如果你的项目正缺一个紧跟前沿、经过充分基准测试的视觉编码器,无论是做检索、生成字幕还是搭建多模态大模型,拿它来用都能省下从头训练的巨大成本。模型权重采用 Apache-2.0 许可,并且已经接入 Hugging Face transformers 和 timm,你可以先试跑小尺寸到超大尺寸的各个版本,或者直接打开 Colab 示例体验一下再决定是否投入。需要留意的是,这套代码偏研究性质,实际使用时你可能要自己复现论文里的评测设置、做一些适配改造,它并不是开箱即用的成品应用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目