GitHub Stars
996
Forks数量
395
贡献者数量
159
许可证
Apache-2.0
收录理由
自建推理服务真正的功夫,往往都花在模型真正跑起来之前。你得先搞清楚某个模型该用哪些启动参数、怎么量化、什么硬件才装得下。这个仓库把社区反复验证过的答案按模型一页页整理了出来,参数规模、dtype、上下文长度、服务配置都清清楚楚,覆盖DeepSeek、GLM、Qwen、Llama等近期发布的开源权重。写指南的人本身就长期在产线环境里跑vLLM,所以很多官方文档一带而过的细节在这里都有交代,例如FP8块量化、多节点部署、Xeon上的CPU推理。你要是经常部署开源权重模型,直接翻这些配置页就行,不必再跑到零散的GitHub issue里去拼凑显存计算公式和投机解码的参数了。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。