#3 · 主分类: 推理与本地部署

vllm

amd blackwell cuda deepseek deepseek-v3 gpt gpt-oss inference kimi llama llm llm-serving model-serving moe openai pytorch qwen qwen3 tpu transformer

面向LLM的高吞吐量、内存高效的推理与服务引擎。

项目最后更新:08/29/26

GitHub Stars

90.4K

Forks数量

21.4K

贡献者数量

3.3K

许可证

Apache-2.0

收录理由

当团队需要把大语言模型真正跑进生产环境时,vLLM 往往是他们最终选定的服务引擎。它能把 Hugging Face 上的模型直接包装成兼容 OpenAI 的 API,靠连续批处理、前缀缓存和高效的键值内存管理,让同一批硬件上能塞进更多并发请求。支持的模型家族和量化格式相当广,而且能跑在 NVIDIA、AMD 和 TPU 上,从单张显卡的小盒子一路扩展到多节点集群。如果你特别在意每个 token 的成本和响应延迟,它提供的推测解码和分离式预填充选项值得认真评估。对于任何要构建可靠、快速服务而不是做笔记本实验的应用来说,这算是一个稳妥的默认选择。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目