#17 · 主分类: 基础模型

Janus

any-to-any foundation-models llm multimodal unified-model vision-language-pretraining

Janus-Series:统一多模态理解与生成模型

项目最后更新:02/01/25

GitHub Stars

17.8K

Forks数量

2.2K

贡献者数量

11

许可证

MIT

收录理由

DeepSeek 的 Janus 系列把图像理解与文生图统一进同一个自回归模型,省去了拼接两套独立视觉与生成模块的麻烦。它的核心做法是让视觉编码走两条独立路径,同一个主干既能回答关于图像的问题,也能根据文字提示画出新图,两种任务互不干扰。仓库里直接提供了 1.3B 和 7B 检查点的推理代码,还带 Gradio 演示,想快速试玩图像描述、视觉问答或指令式生图,本地跑一下就能上手,不必先搭重型管线。JanusFlow 变体则展示了如何在标准 LLM 框架内训练 rectified flow,对想先摸清架构再动手改造的人很有参考价值。整体上,它是评估开源统一多模态模型时一个值得对照的样本。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目