#48 · 主分类: 推理与本地部署
vllm-ascend
ascend
inference
llm
llm-serving
llmops
mlops
model-serving
transformer
vllm
社区维护的硬件插件,用于Ascend上的vLLM
项目最后更新:08/29/26
GitHub Stars
2.7K
Forks数量
2.1K
贡献者数量
592
许可证
Apache-2.0
收录理由
在华为昇腾NPU上跑开源权重模型,过去往往要自己写一套适配硬件的服务代码。这个插件直接挂在vLLM的硬件抽象层上,用起来还是熟悉的vLLM工作流和API,连续批处理、OpenAI兼容接口这些上游能力都在,不用自己折腾设备级内核。项目由vLLM社区维护,紧跟上游发版节奏,昇腾支持不会落后新版本太多。文档里给了容器部署方法、经过测试的模型和NPU平台支持矩阵,还有快速上手示例,想评估昇腾上的推理服务可以从这里入手。如果正打算从CUDA集群迁移,或者要统一到昇腾硬件又不想单独维护一套服务代码,这个项目能省不少事。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。