#152 · 主分类: 推理与本地部署

BigMoeOnEdge

android cpp edge-ai gemma gguf gpt-oss inference llama-cpp llm mixture-of-experts moe on-device-ai qwen

运行超出内存的MoE模型。在12GB手机上仅用CPU无损运行前沿规模MoE,基于原版llama.cpp

项目最后更新:08/31/26

GitHub Stars

514

Forks数量

50

贡献者数量

2

许可证

Apache-2.0

收录理由

这个项目解决了在内存有限的设备上运行大型混合专家模型的实际难题。它抓住了一个关键特性:生成每个token时只激活少数专家,因此把始终需要的部分留在内存里,按需从闪存读取当前请求的专家,其余部分保持在磁盘上。这样即使模型比内存大好几倍,也能在普通手机上无损生成——输出与完全驻留内存的运行结果逐字节一致。项目构建在llama.cpp的公开API之上,并非fork,所以llama.cpp支持的所有量化格式、分词器和聊天模板都能直接使用,跟进上游新版本也只是常规的子模块更新。目前已成功在12GB内存手机上流式运行DeepSeek V4 Flash 0731(约91GB),无需合并分片,也不需要电脑协助。对于想在手机或纯CPU电脑上部署DeepSeek、Qwen这类MoE模型的人来说,这个方案让离线推理真正变得可用,摆脱了对GPU的依赖。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目