#111 · 主分类: 推理与本地部署

vllm-mlx

anthropic anthropic-api apple-silicon claude-code continuous-batching inference-server llm local-llm macos mcp mlx multimodal-ai openai openai-api openai-compatible speech-to-text text-to-speech tool-calling vision-language-model vllm

适用于Apple Silicon的高性能OpenAI和Anthropic兼容LLM推理服务器。原生MLX、连续批处理、多模态模型、MCP工具调用和Claude Code支持。

项目最后更新:08/26/26

GitHub Stars

1.6K

Forks数量

219

贡献者数量

57

许可证

Apache-2.0

收录理由

vllm-mlx 把 Apple Silicon Mac 变成真正的推理服务器,而不是一个演示玩具。它直接跑在原生 MLX 后端上,无需转换模型格式,同时为并发请求带来连续批处理、分页 KV 缓存和前缀缓存,让请求保持流畅而不是排队等待。同一个进程就能处理文本、视觉语言和音频模型,并且在一个端口上同时暴露 OpenAI 和 Anthropic 兼容的接口。后者尤其实用:把 Claude Code 或任何 Anthropic SDK 指向它,你现有的 agent 工具链就能直接对接本地权重,不用改代码。对想要私有、自托管推理,又希望吞吐量拿得出手的团队来说,这种组合在 Mac 上很难找到第二家。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目