#44 · 主分类: 基础模型
Ovis
一种新颖的多模态大语言模型(MLLM)架构,旨在结构化对齐视觉和文本嵌入。
项目最后更新:07/15/26
GitHub Stars
1.5K
Forks数量
89
贡献者数量
5
许可证
Apache-2.0
收录理由
Ovis 为需要视觉语言能力的团队提供了一个省心的选择,不必再费力拼接独立的视觉模型和文本模型。它开源了从 2B 到 34B 的完整多模态大模型系列,架构上把视觉与文本嵌入做了结构化对齐,而不是简单地把视觉模块外挂上去。这个参数跨度意味着你可以在不同任务里按需权衡响应速度与模型能力,近期版本还加入了原生分辨率视觉感知、OCR、多图与视频输入,以及面向推理任务的思考模式。所有权重都直接托管在 Hugging Face 上,还配有在线演示,你可以先拿自己的数据跑一跑,再决定怎么部署。对于想找一款真正读懂图像内容、而不是事后补丁式处理视觉信息的模型来说,Ovis 是一个值得参照的可靠样本。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。