#17 · 主分类: 基础模型
Janus
any-to-any
foundation-models
llm
multimodal
unified-model
vision-language-pretraining
Janus-Series:统一多模态理解与生成模型
项目最后更新:02/01/25
GitHub Stars
17.8K
Forks数量
2.2K
贡献者数量
11
许可证
MIT
收录理由
DeepSeek 的 Janus 系列把图像理解与文生图统一进同一个自回归模型,省去了拼接两套独立视觉与生成模块的麻烦。它的核心做法是让视觉编码走两条独立路径,同一个主干既能回答关于图像的问题,也能根据文字提示画出新图,两种任务互不干扰。仓库里直接提供了 1.3B 和 7B 检查点的推理代码,还带 Gradio 演示,想快速试玩图像描述、视觉问答或指令式生图,本地跑一下就能上手,不必先搭重型管线。JanusFlow 变体则展示了如何在标准 LLM 框架内训练 rectified flow,对想先摸清架构再动手改造的人很有参考价值。整体上,它是评估开源统一多模态模型时一个值得对照的样本。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。