#56 · 主分类: 基础模型

Liquid

autoregressive-models generative generative-ai image-gen large-language-models llms multimodal-large-language-models text-to-image text-to-image-generation

(已被IJCV接收) Liquid:语言模型是可扩展且统一的多模态生成器

项目最后更新:06/01/26

GitHub Stars

640

Forks数量

35

贡献者数量

4

许可证

MIT

收录理由

Liquid 是一个研究型代码库,它验证了一个相当大胆的想法:同一个大语言模型既能理解图像,也能生成图像,而且不需要像 CLIP 那样单独预训练的编码器参与。发布的 7B 指令微调权重同时具备这两种能力,同一套参数既能回答关于图片的问题,也能根据文字提示生成逼真的图像。项目附带 Gradio 演示、文生图、图生文和文生文的推理脚本,还有评估与训练代码,意味着你可以直接跑起来,而不只是读论文。作者还给出了从 0.5B 到 32B 三个模型家族的扩展结果,这对判断统一训练在自己算力规模下是否划算很有参考价值。对于研究多模态基础模型的人来说,权重和复现脚本是最实用的部分。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目