#10 · 主分类: 基础模型

open_clip

computer-vision contrastive-loss deep-learning language-model multi-modal-learning pretrained-models pytorch zero-shot-classification

CLIP的开源实现。

项目最后更新:08/28/26

GitHub Stars

14.1K

Forks数量

1.3K

贡献者数量

71

许可证

Other

收录理由

OpenCLIP 是开源社区里做视觉-语言对比学习时最常被直接采用的 PyTorch 实现。它把图像和文本映射到同一个向量空间,因此能直接支撑零样本分类、跨模态检索和语义搜索这类任务;仓库里既有完整的训练代码,也附带大量预训练权重,几行代码就能加载使用。训练规模可以从单卡微调一路扩展到多机集群,对分布式训练和 FSDP2 都提供了支持。主分支早已超出最初 CLIP 的范畴,加入了可变分辨率图像塔、音频-文本变体以及若干解码器风格的新模型族,而 v3 分支则保留了相对稳定的 API,适合不想频繁跟进实验性改动的团队。如果你原本打算从头实现对比预训练流程,这个项目是一个可靠且可复现的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目