#80 · 主分类: 基础模型
LLaVA-Mini
LLaVA-Mini 是一个统一的大型多模态模型(LMM),能够高效地支持图像、高分辨率图像和视频的理解。
项目最后更新:06/29/25
GitHub Stars
577
Forks数量
34
贡献者数量
2
许可证
Apache-2.0
收录理由
多数多模态模型每看一张图都要付出高昂的计算和内存代价,因为一张图会被拆成几百个视觉token。LLaVA-Mini把整张图压缩成一个token,作者称这能减少约77%的浮点运算量,单图显存占用从几百MB降到不足1MB,同时精度仍接近LLaVA-v1.5。这种节省延伸到视频处理上,模型能在单块24GB显卡上跑完超长视频,让原本成本过高的应用变得可行。仓库里带了Gradio演示、图片和视频的命令行脚本,以及训练和评估文档,下载Hugging Face权重后很快就能搭出可用的界面。这是基于LLaVA代码库的研究版本,需要自己适配而非开箱即用,但效率提升是实打实可测量的。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。