#104 · 主分类: 推理与本地部署

vllm-metal

社区维护的适用于Apple Silicon的vLLM硬件插件。

项目最后更新:08/29/26

GitHub Stars

1.7K

Forks数量

233

贡献者数量

61

许可证

Apache-2.0

收录理由

这个插件把 vLLM 的推理服务搬到了 Apple Silicon 上,计算后端从 CUDA 换成了 MLX,但 vllm 命令行和 HTTP 接口保持不变。如果你已经在 GPU 上跑 vLLM,团队里那套调用方式可以直接拿到 Mac 上复用,不用再维护第二套推理工具。项目是社区维护的,不是 vLLM 官方构建,不过 v0.2.0 版本重写了注意力内核,官方报告说相比 v0.1.0,首 Token 延迟降低了 83 倍,吞吐提升了 3.6 倍。如果你希望数据中心 GPU 和本地 Mac 共用一套推理框架,这种一致性是它最值得尝试的地方。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目