#50 · 主分类: 推理与本地部署
kimi-k3-in-c
2.78万亿参数的Kimi K3,在8.24 GB内存的单CPU上运行推理。便携C99:无需BLAS、无框架、无GPU。
项目最后更新:08/26/26
GitHub Stars
6.7K
Forks数量
1.1K
贡献者数量
10
许可证
Apache-2.0
收录理由
在单块 CPU 上运行 2.78 万亿参数的大模型,通常需要一整台集群才能做到,但这个项目只用约 8 GB 内存就完成了推理。它是一套用可移植 C99 从零写成的推理引擎,不依赖 BLAS、不依赖任何深度学习框架,也不需要 GPU。实现思路是每一步都从磁盘流式读取 1.56 TB 的检查点,只在内存中保留选定的主干部分,所以无论你分配多少内存,输出结果都逐字节一致,预算只影响耗时。代价是速度和便利性:这是基座模型,生成的是文本续写而不是对话回复,每个 token 要花数秒而非毫秒。对于想了解内存高效 MoE 推理、打包 4 位专家路由、或者好奇普通 CPU 极限在哪里的系统程序员来说,这个取舍正是项目有趣的地方。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。