#46 · 主分类: 基础模型
NEO
NEO系列:基于第一性原理的原生视觉-语言模型
项目最后更新:07/27/26
GitHub Stars
888
Forks数量
31
贡献者数量
3
许可证
Apache-2.0
收录理由
NEO 对多模态建模的处理方式与大多数视觉语言模型项目截然不同:它并不在 LLM 上外挂一个独立的视觉编码器,而是将像素与文本放在同一个稠密架构中一起训练。仓库里配备了实打实的配套资源——Hugging Face 上的 2B 与 9B 权重、用于训练这些模型的完整配方,以及评估工具链,让你可以复现论文中的结果,或者按自己的任务微调模型,不必一味相信论文的说法。真正有意思的是它在效率上的主张:作者称其视觉理解能力能做到与模块化系统相当,但训练时所用的图文数据量只有后者的一小部分。对正在权衡当前开源视觉语言方案的人,特别是对无编码器设计感兴趣的团队来说,这里既有能直接跑起来的代码,也提供了一个有价值的参照点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。