#137 · 主分类: 推理与本地部署
qwen38-27b-rtx3090
在单张RTX 3090上使用vLLM运行Qwen3.8-27B:并发约1000 tok/s,单用户114-124 tok/s,通过MTP推测和int8 GEMM实现15万+上下文,以及校准的int4量化。
项目最后更新:08/27/26
GitHub Stars
897
Forks数量
113
贡献者数量
8
许可证
Apache-2.0
收录理由
把270亿参数的大模型压进一块24GB消费级显卡,通常意味着要自己动手做量化、打补丁、调内存。这个项目把这些前置工作全部搞定:提供预构建的Docker镜像,启动时自动下载并重新量化模型,应用一组vLLM补丁,对外暴露带密钥认证的OpenAI兼容接口——一条容器命令就得到一个可用的服务。两种启动配置分别面向少量交互式聊天用户和高并发批处理后端,README里还详细记录了在RTX 3090上的实际表现:单流聊天配合投机解码约120 token/s,64并发时聚合解码约1000 token/s。每次推送镜像前,CI门槛都会先跑验证脚本,所以latest标签始终是维护者测试过的版本。手头有一张高端显卡,又不想租云算力,想自己托管新版Qwen模型的话,这些基准数据和重新量化脚本把每个设置能换来什么性能都写得很清楚。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。