#3 · 主分类: 基础模型
MiniCPM-V
袖珍型MLLM,在手机上实现超高效的图像和视频理解
项目最后更新:08/26/26
GitHub Stars
26.3K
Forks数量
2.1K
贡献者数量
38
许可证
Apache-2.0
收录理由
MiniCPM-V 是一系列多模态大语言模型,设计思路是牺牲一点模型规模来换取实用性:这些模型小到能直接跑在手机、平板和边缘设备上,同时依然能处理图像、视频和文本输入。其中 1.3B 参数的 MiniCPM-V 4.6 在视觉编码早期就压缩视觉 token,把编码计算量砍掉一半以上,吞吐量却没有因此下降;仓库里还附带了针对 iOS、Android 和 HarmonyOS 的端侧适配代码。同系列的 MiniCPM-o 4.5 更进一步,支持流式视频和音频输入,还能输出语音,实现实时交互,让模型在对话中既能看、能听,也能开口说话。这些模型可以接入 Ollama、llama.cpp 和 vLLM,你既能在本地快速做原型验证,之后也不用更换技术栈就能直接部署上线。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。