#18 · 主分类: 推理与本地部署

1Cat-vLLM

专注于V100/SM70的vLLM工程分支,用于现代LLM推理。

项目最后更新:08/29/26

GitHub Stars

718

Forks数量

121

贡献者数量

2.7K

许可证

Apache-2.0

收录理由

不少小团队手里还压着Tesla V100,可新版vLLM要么不再支持Volta架构,要么跑起来慢到让人怀疑人生。这个分支把vLLM的推理服务框架保留下来,专门补上V100缺的那几块:针对SM70优化的内核、独立的V100 FlashAttention后端,以及为Qwen系列模型调好的AWQ 4-bit推理路径。它给出了经过验证的启动配置,能在双卡或四卡V100上跑27B和35B的AWQ模型,默认支持长上下文,OpenAI兼容接口也能被常见客户端直接调用。对已经拥有这些卡片的团队来说,这意味着能真正搭起一个可用的模型服务,而不是把硬件判死刑。如果你正为老款NVIDIA数据中心GPU的剩余价值发愁,这里给出的具体、可复现的部署命令,远比泛泛的建议更有用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目