#3 · 主分类: 基础模型

MiniCPM-V

minicpm minicpm-o minicpm-v multi-modal

袖珍型MLLM,在手机上实现超高效的图像和视频理解

项目最后更新:08/26/26

GitHub Stars

26.3K

Forks数量

2.1K

贡献者数量

38

许可证

Apache-2.0

收录理由

MiniCPM-V 是一系列多模态大语言模型,设计思路是牺牲一点模型规模来换取实用性:这些模型小到能直接跑在手机、平板和边缘设备上,同时依然能处理图像、视频和文本输入。其中 1.3B 参数的 MiniCPM-V 4.6 在视觉编码早期就压缩视觉 token,把编码计算量砍掉一半以上,吞吐量却没有因此下降;仓库里还附带了针对 iOS、Android 和 HarmonyOS 的端侧适配代码。同系列的 MiniCPM-o 4.5 更进一步,支持流式视频和音频输入,还能输出语音,实现实时交互,让模型在对话中既能看、能听,也能开口说话。这些模型可以接入 Ollama、llama.cpp 和 vLLM,你既能在本地快速做原型验证,之后也不用更换技术栈就能直接部署上线。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目