#80 · 主分类: 推理与本地部署

Rapid-MLX

apple-silicon claude-code cursor deepseek fastapi hacktoberfest inference llm local-llm m1 m2 m3 macos mlx ollama-alternative openai-api python qwen tool-calling

Apple Silicon 上最快的本地 AI 引擎。比 Ollama 快 4.2 倍,缓存 TTFT 0.08 秒,100% 工具调用。17 种工具解析器、提示缓存、推理分离、云路由。OpenAI 的即插即用替代品。兼容 Claude Code、Cursor、Aider。

项目最后更新:08/30/26

GitHub Stars

3.6K

Forks数量

402

贡献者数量

53

许可证

Other

收录理由

在 Mac 上跑本地大模型,往往要忍受漫长的模型加载,还得跟不听话的工具调用较劲。Rapid-MLX 把这两件事一起解决了:它专门为 Apple Silicon 打造,对外提供 OpenAI 和 Anthropic 兼容的 API,像 Claude Code、Cursor、Aider 这类现成工具无需改动配置,直接就能指向本机模型。速度之外,它内置了 17 种工具解析器,让模型稳定输出结构化函数调用;推理 token 与主回复分开处理;还有 prompt 缓存,重复请求的延迟能明显降下来。想切换到云端服务时,它也留了路由选项作为备选。对用 M 系列笔记本的开发者或小团队来说,想要私有、离线、又不想碰沉重容器栈的推理环境,这是个很实际的本地服务替代品。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目