#46 · 主分类: 基础模型

NEO

agi encoder-free-vlm large-language-models mllm multimodal multimodal-large-language-models native-multimodal-model vlm

NEO系列:基于第一性原理的原生视觉-语言模型

项目最后更新:07/27/26

GitHub Stars

888

Forks数量

31

贡献者数量

3

许可证

Apache-2.0

收录理由

NEO 对多模态建模的处理方式与大多数视觉语言模型项目截然不同:它并不在 LLM 上外挂一个独立的视觉编码器,而是将像素与文本放在同一个稠密架构中一起训练。仓库里配备了实打实的配套资源——Hugging Face 上的 2B 与 9B 权重、用于训练这些模型的完整配方,以及评估工具链,让你可以复现论文中的结果,或者按自己的任务微调模型,不必一味相信论文的说法。真正有意思的是它在效率上的主张:作者称其视觉理解能力能做到与模块化系统相当,但训练时所用的图文数据量只有后者的一小部分。对正在权衡当前开源视觉语言方案的人,特别是对无编码器设计感兴趣的团队来说,这里既有能直接跑起来的代码,也提供了一个有价值的参照点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目