#104 · 主分类: 推理与本地部署

recipes

运行 vLLM 的常见方案

项目最后更新:08/30/26

GitHub Stars

996

Forks数量

395

贡献者数量

159

许可证

Apache-2.0

收录理由

自建推理服务真正的功夫,往往都花在模型真正跑起来之前。你得先搞清楚某个模型该用哪些启动参数、怎么量化、什么硬件才装得下。这个仓库把社区反复验证过的答案按模型一页页整理了出来,参数规模、dtype、上下文长度、服务配置都清清楚楚,覆盖DeepSeek、GLM、Qwen、Llama等近期发布的开源权重。写指南的人本身就长期在产线环境里跑vLLM,所以很多官方文档一带而过的细节在这里都有交代,例如FP8块量化、多节点部署、Xeon上的CPU推理。你要是经常部署开源权重模型,直接翻这些配置页就行,不必再跑到零散的GitHub issue里去拼凑显存计算公式和投机解码的参数了。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目