#17 · 主分类: 推理与本地部署

omlx

apple-silicon inference-server llm macos mlx openai-api

适用于Apple Silicon的LLM推理服务器,支持连续批处理和SSD缓存,可从macOS菜单栏管理。

项目最后更新:08/29/26

GitHub Stars

21.0K

Forks数量

1.8K

贡献者数量

251

许可证

Apache-2.0

收录理由

oMLX 是一款专为 Apple Silicon 打造的 LLM 推理服务器,难得的是它给人的感觉是成品而非拼凑。单个进程就能同时服务文本模型、视觉语言模型、嵌入和重排序,并对外提供 OpenAI 兼容接口,Claude Code、Cursor 这类工具几乎不用额外配置就能接上。它真正的亮点是分层 KV 缓存:热数据留在内存,冷数据落到 SSD,而且缓存能跨上下文变化和服务器重启保留,长编码会话不必从头重算。连续批处理让并发请求下的吞吐保持稳定,菜单栏应用和管理面板则让你直观地加载、固定或驱逐模型,不用去改配置文件。如果你在 Mac 上跑本地模型,又希望有深度的缓存而不想自己组装一堆工具,这个项目值得一看。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目