#170 · 主分类: 推理与本地部署

Medusa

llm llm-inference

Medusa:简单框架,用于通过多个解码头加速LLM生成

项目最后更新:06/25/24

GitHub Stars

2.8K

Forks数量

205

贡献者数量

11

许可证

Apache-2.0

收录理由

常见的令牌生成加速方案大多依赖一个额外的小型草稿模型,这个模型需要单独训练、调优,还得时刻与主模型保持同步,运维起来相当麻烦。Medusa 换了一条路:直接在现有模型上训练几个轻量级的解码头,原始权重完全不动,分布式计算环境也几乎不用调整。这样省去了额外模型的维护负担,训练成本也更低。根据技术报告,在多种常见大语言模型上,它能带来 2.2 到 3.6 倍的加速,而且无论是贪心解码还是采样生成都适用。对于已经微调过模型、希望降低推理延迟又不想改动现有服务架构的团队来说,是个很实际的方案。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目