GitHub Stars
616
Forks数量
28
贡献者数量
2
许可证
Other
收录理由
摘要生成、文档问答、多轮对话和代码编辑这类任务有个共同点:模型在输出时常常会直接照抄输入里的短语或代码片段。Prompt Lookup Decoding 正是抓住这一点,用简单的 n-gram 匹配来替代推测解码中常用的草稿模型,从输入中找出候选 token 序列,再通过一次前向传播验证。这样既不影响输出质量,又能在这些输入相关的任务上把吞吐量提升 2 到 4 倍。参考实现非常精简,读一遍就能理解;而且这个方法已经被 Hugging Face transformers 和 vLLM 内置,只需设置一个参数即可启用,无需维护额外代码。它适用于任何解码器模型,支持贪心解码和采样,也不需要外部数据存储。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。