#132 · 主分类: 推理与本地部署

MinivLLM

基于Nano-vLLM,一个简单的vLLM复刻,包含自包含的分页注意力和闪存注意力实现。

项目最后更新:08/29/26

GitHub Stars

1.0K

Forks数量

172

贡献者数量

14

许可证

Apache-2.0

收录理由

对于在用 vLLM 跑生产环境却从未深入过引擎内部的人来说,这个项目很有启发。它从头把推理引擎重写了一遍,用自包含的 Triton 实现 paged attention 和 flash attention,不依赖第三方库,所以内核逻辑清晰可查。仓库提供预填充和解码阶段的基准测试,对比标准 PyTorch 注意力、朴素 Triton 核和 flash attention 的实现,能直观看到内存和延迟之间的权衡。还附有逐步指南,讲解模型层、paged attention、CUDA graph 和调度,等于为想自己调优或排查服务栈的团队铺了一条上手路径,不必把 vLLM 当成黑盒。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目