#154 · 主分类: 推理与本地部署

vLLM-Moet

一个vLLM补丁 + 手写SM120 SASS内核:2位MoE专家 + FP4 'delta'缓存以恢复精度——在消费级Blackwell显卡上匹配官方(NV)FP4检查点的质量

项目最后更新:08/28/26

GitHub Stars

536

Forks数量

50

贡献者数量

4

许可证

Apache-2.0

收录理由

前沿MoE模型的官方权重往往体积巨大,消费级Blackwell显卡根本装不下,这个项目直接瞄准了这道坎。它没有另起炉灶,而是在官方vLLM v0.24.0上打了一个运行时补丁,再配上手写的SM120内核,把路由专家压缩到2比特,同时用FP4增量缓存把精度找补回来——正是靠这套组合,GLM-5.2(753B)、DeepSeek-V4-Flash(159B)和Kimi-K2.7-Code(1T)才能在RTX 5090和RTX PRO 6000上跑起来。README里给出了实测数据:解码和预填充吞吐、经过针检索验证的上下文窗口长度,还有一套分层的专家驻留机制——显存不够时先挪到主机内存钉住,再不够就落到NVMe打包文件里,用固定内存做交换区,GPU只当专家缓存用。它基于官方vLLM发行版生成补丁,不是维护一个分叉,还预编译了TP2/TP4的cubin,已经在用vLLM的团队不用额外维护一套代码就能接上。想在Blackwell上本地跑前沿规模MoE的话,这份参考相当具体。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目