#147 · 主分类: 推理与本地部署

mlx-dspark

apple-silicon claude-code codex dflash2 dspark inference-engine llm-inference local-llm macos metal mlx pi qwen3-8 speculative-decoding

在Apple Silicon上实现高达4倍的LLM解码速度,无损。DeepSeek的DSpark和z-lab的DFlash投机解码的原生MLX移植——支持Gemma-4、Qwen3.8、Muse-Glimmer、Nemotron、LFM2.5、Ornith-1.0、三元Bonsai-27B。

项目最后更新:08/27/26

GitHub Stars

620

Forks数量

50

贡献者数量

3

许可证

MIT

收录理由

mlx-dspark 把 DeepSeek 的 DSpark 和 z-lab 的 DFlash 两种投机解码草稿器移植到了 Apple Silicon 上,底层走 MLX。它最吸引人的地方是“无损”:目标模型会逐个验证生成的 token,所以解码速度能提上去,但输出和普通解码完全一致,一个字节都不差。对于跑 agent 循环或者对外提供响应、容不得质量波动的场景,这个保证本身就值得一试。它面向的是 Gemma-4、Qwen3、Muse-Glimmer、Nemotron 这类消费级尺寸的模型,使用方式也灵活——命令行、Python 脚本,或者起一个兼容 OpenAI 的服务器,接进 LM Studio 或其他本地工具都行。另外它还带基准测试模式,会在你自己的机器上实测,然后据此挑选草稿长度,而不是硬套一个默认值;想针对手头硬件做调优的话,这个功能挺实用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目