#97 · 主分类: 基础模型

VisCPM

diffusion-models large-language-models multimodal transformers

基于CPM基础模型的中英双语多模态大模型系列

项目最后更新:06/13/24

GitHub Stars

1.1K

Forks数量

88

贡献者数量

5

许可证

Other

收录理由

VisCPM把视觉语言任务的两端都收进同一个模型家族:既能看图对话,也能用文字生成图像,中英文都支持。它以百亿参数的CPM-Bee语言模型为底座,接上视觉编码器做多模态对话,配上扩散UNet做文生图,共享一套主干。值得留意的是,它只用英文多模态数据预训练,就能把能力泛化到中文,这样中文团队不必费心攒大规模的中文配对数据。仓库里给了可复现的训练方案、低资源推理(聊天模型大约5GB显存)、微调支持和本地网页演示,无论是复现研究还是接入产品都比较顺手。如果希望用更新的权重,项目还指向了OmniLMM和MiniCPM-V等后继版本。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目