#87 · 主分类: 计算机视觉

Chinese-CLIP

chinese clip computer-vision contrastive-loss coreml-models deep-learning image-text-retrieval multi-modal multi-modal-learning nlp pretrained-models pytorch transformers vision-and-language-pre-training vision-language

中文版CLIP,实现中文跨模态检索和表征生成。

项目最后更新:03/31/26

GitHub Stars

6.0K

Forks数量

552

贡献者数量

11

许可证

MIT

收录理由

做中文图文匹配的产品团队,比如商品检索或照片库搜索,常从 Chinese-CLIP 入手。它用约两亿中文图文对训练出图像和文本编码器,直接算特征相似度、做跨模态检索,不必自己攒数据。零样本分类也很省事,把候选类别用中文写出来就能跑。除了开箱即用的推理接口,仓库里还带着训练和微调代码,方便把模型调到自己的业务数据上。另外提供 ONNX、TensorRT、CoreML 的转换脚本,部署到实际环境不费劲,和 Hugging Face transformers 的集成也让老管道能顺滑接进来。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目