GitHub Stars
718
Forks数量
121
贡献者数量
2.7K
许可证
Apache-2.0
收录理由
不少小团队手里还压着Tesla V100,可新版vLLM要么不再支持Volta架构,要么跑起来慢到让人怀疑人生。这个分支把vLLM的推理服务框架保留下来,专门补上V100缺的那几块:针对SM70优化的内核、独立的V100 FlashAttention后端,以及为Qwen系列模型调好的AWQ 4-bit推理路径。它给出了经过验证的启动配置,能在双卡或四卡V100上跑27B和35B的AWQ模型,默认支持长上下文,OpenAI兼容接口也能被常见客户端直接调用。对已经拥有这些卡片的团队来说,这意味着能真正搭起一个可用的模型服务,而不是把硬件判死刑。如果你正为老款NVIDIA数据中心GPU的剩余价值发愁,这里给出的具体、可复现的部署命令,远比泛泛的建议更有用。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。