#107 · 主分类: 基础模型

CoCa-pytorch

artificial-intelligence attention-mechanism contrastive-learning deep-learning image-to-text multimodal transformers

CoCa的PyTorch实现,对比字幕器是图像-文本基础模型。

项目最后更新:12/12/23

GitHub Stars

1.2K

Forks数量

89

贡献者数量

1

许可证

MIT

收录理由

CoCa-pytorch 是 Phil Wang 对 CoCa 架构的 PyTorch 实现,这套对比式字幕模型把对比学习巧妙地融进了常规的图像到文本编码器-解码器 Transformer 中。论文显示,微调编码器后在 ImageNet 上达到 91.0% 的 top-1 准确率,代码沿用了 PaLM 风格的 Transformer 结构,包括并行的 SwiGLU 前馈层。如果你不想调用云端 API,而是打算自己训练图像-文本模型,代码里的用法示例会告诉你如何接入预训练的视觉 Transformer,并输出字幕 logits 或 CLIP 风格的嵌入向量。需要提醒的是,仓库并没有提供预训练权重,数据采集和训练流程都得自己动手;OpenClip 团队倒是训好了 CoCa 权重,可以拿来微调。对于想彻底搞懂模型内部构造的研究者或工程师,这个实现比开箱即用的部署方案更有价值。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目