#48 · 主分类: 推理与本地部署

vllm-ascend

ascend inference llm llm-serving llmops mlops model-serving transformer vllm

社区维护的硬件插件,用于Ascend上的vLLM

项目最后更新:08/29/26

GitHub Stars

2.7K

Forks数量

2.1K

贡献者数量

592

许可证

Apache-2.0

收录理由

在华为昇腾NPU上跑开源权重模型,过去往往要自己写一套适配硬件的服务代码。这个插件直接挂在vLLM的硬件抽象层上,用起来还是熟悉的vLLM工作流和API,连续批处理、OpenAI兼容接口这些上游能力都在,不用自己折腾设备级内核。项目由vLLM社区维护,紧跟上游发版节奏,昇腾支持不会落后新版本太多。文档里给了容器部署方法、经过测试的模型和NPU平台支持矩阵,还有快速上手示例,想评估昇腾上的推理服务可以从这里入手。如果正打算从CUDA集群迁移,或者要统一到昇腾硬件又不想单独维护一套服务代码,这个项目能省不少事。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目