#143 · 主分类: 推理与本地部署
vLLM-2080Ti-Definitive
适用于双RTX 2080 Ti 22GB + NVLink的终极vLLM运行时,支持FP8权重,实现Qwen 27B本地推理,单请求解码速度最高100+ tok/s(加入Discord:https://discord.gg/VFqVVySdMS)
项目最后更新:08/27/26
GitHub Stars
741
Forks数量
110
贡献者数量
9
许可证
Apache-2.0
收录理由
这个分支对 vLLM 做了针对性修补,让两张经过 22GB 显存改造并启用 NVLink 的 RTX 2080 Ti 显卡,能在本地跑起 Qwen3.x 27B 模型,单请求解码速度实测超过每秒 100 token。项目把补丁源码、启动配置和运行笔记都完整保留下来,照着做就能复现这套可用的推理环境,不用再去和 vLLM 对老图灵架构的默认支持较劲。仓库里验证了具体的模型权重和长上下文路线,包括 256K 纯文本和 136K 图文混合,还支持 MTP 解码和 FP8 权重。如果你手里有老图灵卡,想用不高的预算搭一套能认真跑单个大模型的本地推理环境,这个项目很实在。不过它针对的是单并发的个人助手场景,不是多租户服务。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。