#10 · 主分类: 基础模型
open_clip
computer-vision
contrastive-loss
deep-learning
language-model
multi-modal-learning
pretrained-models
pytorch
zero-shot-classification
CLIP的开源实现。
项目最后更新:08/28/26
GitHub Stars
14.1K
Forks数量
1.3K
贡献者数量
71
许可证
Other
收录理由
OpenCLIP 是开源社区里做视觉-语言对比学习时最常被直接采用的 PyTorch 实现。它把图像和文本映射到同一个向量空间,因此能直接支撑零样本分类、跨模态检索和语义搜索这类任务;仓库里既有完整的训练代码,也附带大量预训练权重,几行代码就能加载使用。训练规模可以从单卡微调一路扩展到多机集群,对分布式训练和 FSDP2 都提供了支持。主分支早已超出最初 CLIP 的范畴,加入了可变分辨率图像塔、音频-文本变体以及若干解码器风格的新模型族,而 v3 分支则保留了相对稳定的 API,适合不想频繁跟进实验性改动的团队。如果你原本打算从头实现对比预训练流程,这个项目是一个可靠且可复现的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。