#133 · 主分类: 推理与本地部署

speculators

一个用于在vLLM中构建、评估和存储LLM推理推测解码算法的统一库。

项目最后更新:08/28/26

GitHub Stars

782

Forks数量

204

贡献者数量

55

许可证

Apache-2.0

收录理由

投机解码能在不改变输出结果的前提下显著降低推理延迟:小模型提前草拟多个token,大模型一次前向验证,响应速度提升而质量无损。这个库把这一思路做成了可落地的生产工具,提供了从训练草稿模型到打包成Hugging Face格式的完整流程,训练好的模型几乎不用额外配置就能直接跑进vLLM。它支持EAGLE-3、DFlash、DSpark、P-EAGLE等多种现代草稿算法,也兼容MoE、稠密和视觉语言验证器,覆盖的模型范围比较广。对不想自己从头折腾草稿模型训练的推理工程师来说,这是一条有维护、有标准化的提速路径。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目