#56 · 主分类: 基础模型
Liquid
autoregressive-models
generative
generative-ai
image-gen
large-language-models
llms
multimodal-large-language-models
text-to-image
text-to-image-generation
(已被IJCV接收) Liquid:语言模型是可扩展且统一的多模态生成器
项目最后更新:06/01/26
GitHub Stars
640
Forks数量
35
贡献者数量
4
许可证
MIT
收录理由
Liquid 是一个研究型代码库,它验证了一个相当大胆的想法:同一个大语言模型既能理解图像,也能生成图像,而且不需要像 CLIP 那样单独预训练的编码器参与。发布的 7B 指令微调权重同时具备这两种能力,同一套参数既能回答关于图片的问题,也能根据文字提示生成逼真的图像。项目附带 Gradio 演示、文生图、图生文和文生文的推理脚本,还有评估与训练代码,意味着你可以直接跑起来,而不只是读论文。作者还给出了从 0.5B 到 32B 三个模型家族的扩展结果,这对判断统一训练在自己算力规模下是否划算很有参考价值。对于研究多模态基础模型的人来说,权重和复现脚本是最实用的部分。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。