GitHub Stars
2.8K
Forks数量
205
贡献者数量
11
许可证
Apache-2.0
收录理由
常见的令牌生成加速方案大多依赖一个额外的小型草稿模型,这个模型需要单独训练、调优,还得时刻与主模型保持同步,运维起来相当麻烦。Medusa 换了一条路:直接在现有模型上训练几个轻量级的解码头,原始权重完全不动,分布式计算环境也几乎不用调整。这样省去了额外模型的维护负担,训练成本也更低。根据技术报告,在多种常见大语言模型上,它能带来 2.2 到 3.6 倍的加速,而且无论是贪心解码还是采样生成都适用。对于已经微调过模型、希望降低推理延迟又不想改动现有服务架构的团队来说,是个很实际的方案。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。