#111 · 主分类: 推理与本地部署
vllm-mlx
适用于Apple Silicon的高性能OpenAI和Anthropic兼容LLM推理服务器。原生MLX、连续批处理、多模态模型、MCP工具调用和Claude Code支持。
项目最后更新:08/26/26
GitHub Stars
1.6K
Forks数量
219
贡献者数量
57
许可证
Apache-2.0
收录理由
vllm-mlx 把 Apple Silicon Mac 变成真正的推理服务器,而不是一个演示玩具。它直接跑在原生 MLX 后端上,无需转换模型格式,同时为并发请求带来连续批处理、分页 KV 缓存和前缀缓存,让请求保持流畅而不是排队等待。同一个进程就能处理文本、视觉语言和音频模型,并且在一个端口上同时暴露 OpenAI 和 Anthropic 兼容的接口。后者尤其实用:把 Claude Code 或任何 Anthropic SDK 指向它,你现有的 agent 工具链就能直接对接本地权重,不用改代码。对想要私有、自托管推理,又希望吞吐量拿得出手的团队来说,这种组合在 Mac 上很难找到第二家。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。