#147 · 主分类: 推理与本地部署
mlx-dspark
在Apple Silicon上实现高达4倍的LLM解码速度,无损。DeepSeek的DSpark和z-lab的DFlash投机解码的原生MLX移植——支持Gemma-4、Qwen3.8、Muse-Glimmer、Nemotron、LFM2.5、Ornith-1.0、三元Bonsai-27B。
项目最后更新:08/27/26
GitHub Stars
620
Forks数量
50
贡献者数量
3
许可证
MIT
收录理由
mlx-dspark 把 DeepSeek 的 DSpark 和 z-lab 的 DFlash 两种投机解码草稿器移植到了 Apple Silicon 上,底层走 MLX。它最吸引人的地方是“无损”:目标模型会逐个验证生成的 token,所以解码速度能提上去,但输出和普通解码完全一致,一个字节都不差。对于跑 agent 循环或者对外提供响应、容不得质量波动的场景,这个保证本身就值得一试。它面向的是 Gemma-4、Qwen3、Muse-Glimmer、Nemotron 这类消费级尺寸的模型,使用方式也灵活——命令行、Python 脚本,或者起一个兼容 OpenAI 的服务器,接进 LM Studio 或其他本地工具都行。另外它还带基准测试模式,会在你自己的机器上实测,然后据此挑选草稿长度,而不是硬套一个默认值;想针对手头硬件做调优的话,这个功能挺实用。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。