#41 · 主分类: 推理与本地部署
Mooncake
Mooncake是Kimi的服务平台,Kimi是Moonshot AI提供的领先LLM服务。
项目最后更新:08/29/26
GitHub Stars
6.4K
Forks数量
1.1K
贡献者数量
310
许可证
Apache-2.0
收录理由
大规模运行大语言模型时,流量波动很容易拖垮延迟,而Mooncake正是为应对这种场景设计的。Moonshot AI的Kimi助手就跑在这套平台上,所以它的能力已经在真实的高并发流量下得到验证,而非只停留在基准测试里。Mooncake把预填充和解码拆分到集群中,并通过RDMA传递KV缓存,这样繁忙的GPU就不会因为内存带宽或慢速对象存储而卡顿。如果你已经在用vLLM或SGLang,它的传输引擎可以直接嵌入,作为升级而不必重写系统。FAST'25论文和开源组件为你在自己的硬件上做调优提供了具体起点。当然,前期需要投入一些分布式系统的工作,但回报是让你现有的GPU集群产出更多tokens每秒。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。