GitHub Stars
782
Forks数量
204
贡献者数量
55
许可证
Apache-2.0
收录理由
投机解码能在不改变输出结果的前提下显著降低推理延迟:小模型提前草拟多个token,大模型一次前向验证,响应速度提升而质量无损。这个库把这一思路做成了可落地的生产工具,提供了从训练草稿模型到打包成Hugging Face格式的完整流程,训练好的模型几乎不用额外配置就能直接跑进vLLM。它支持EAGLE-3、DFlash、DSpark、P-EAGLE等多种现代草稿算法,也兼容MoE、稠密和视觉语言验证器,覆盖的模型范围比较广。对不想自己从头折腾草稿模型训练的推理工程师来说,这是一条有维护、有标准化的提速路径。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。