GitHub Stars
1.7K
Forks数量
233
贡献者数量
61
许可证
Apache-2.0
收录理由
这个插件把 vLLM 的推理服务搬到了 Apple Silicon 上,计算后端从 CUDA 换成了 MLX,但 vllm 命令行和 HTTP 接口保持不变。如果你已经在 GPU 上跑 vLLM,团队里那套调用方式可以直接拿到 Mac 上复用,不用再维护第二套推理工具。项目是社区维护的,不是 vLLM 官方构建,不过 v0.2.0 版本重写了注意力内核,官方报告说相比 v0.1.0,首 Token 延迟降低了 83 倍,吞吐提升了 3.6 倍。如果你希望数据中心 GPU 和本地 Mac 共用一套推理框架,这种一致性是它最值得尝试的地方。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。