#221 · 主分类: 深度学习框架

x-clip

artificial-intelligence contrastive-learning deep-learning multi-modal-learning zero-shot-learning

一个简洁但完整的CLIP实现,包含来自近期论文的各种实验性改进。

项目最后更新:10/16/23

GitHub Stars

724

Forks数量

49

贡献者数量

1

许可证

MIT

收录理由

x-clip 是一个紧凑的 PyTorch 实现,面向那些希望自己训练图像-文本对比模型、而非微调预训练检查点的团队。整个架构集中在一个类中,通过少量维度参数即可配置,因此你可以用自己的配对数据训练出定制化的嵌入空间,而不是依赖 OpenAI 的固定权重。对研究而言,它把近期论文中的若干技巧做成了开关:FLIP 的 patch dropout、FILIP 的 token 级对比学习、解耦对比损失,以及 DeCLIP 中的辅助自监督或掩码语言目标。你也可以把外部视觉 Transformer 或残差网络作为图像编码器接入,这样就能复用已有骨干网络,把精力集中在对比头部分。这是一个训练库,不是现成模型,所以需要自己准备数据管道和评估流程。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目