#3 · 主分类: 推理与本地部署
vllm
amd
blackwell
cuda
deepseek
deepseek-v3
gpt
gpt-oss
inference
kimi
llama
llm
llm-serving
model-serving
moe
openai
pytorch
qwen
qwen3
tpu
transformer
面向LLM的高吞吐量、内存高效的推理与服务引擎。
项目最后更新:08/29/26
GitHub Stars
90.4K
Forks数量
21.4K
贡献者数量
3.3K
许可证
Apache-2.0
收录理由
当团队需要把大语言模型真正跑进生产环境时,vLLM 往往是他们最终选定的服务引擎。它能把 Hugging Face 上的模型直接包装成兼容 OpenAI 的 API,靠连续批处理、前缀缓存和高效的键值内存管理,让同一批硬件上能塞进更多并发请求。支持的模型家族和量化格式相当广,而且能跑在 NVIDIA、AMD 和 TPU 上,从单张显卡的小盒子一路扩展到多节点集群。如果你特别在意每个 token 的成本和响应延迟,它提供的推测解码和分离式预填充选项值得认真评估。对于任何要构建可靠、快速服务而不是做笔记本实验的应用来说,这算是一个稳妥的默认选择。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。