#196 · 主分类: 推理与本地部署

prompt-lookup-decoding

简单的推测解码技术,集成于vLLM和transformers中

项目最后更新:08/23/24

GitHub Stars

616

Forks数量

28

贡献者数量

2

许可证

Other

收录理由

摘要生成、文档问答、多轮对话和代码编辑这类任务有个共同点:模型在输出时常常会直接照抄输入里的短语或代码片段。Prompt Lookup Decoding 正是抓住这一点,用简单的 n-gram 匹配来替代推测解码中常用的草稿模型,从输入中找出候选 token 序列,再通过一次前向传播验证。这样既不影响输出质量,又能在这些输入相关的任务上把吞吐量提升 2 到 4 倍。参考实现非常精简,读一遍就能理解;而且这个方法已经被 Hugging Face transformers 和 vLLM 内置,只需设置一个参数即可启用,无需维护额外代码。它适用于任何解码器模型,支持贪心解码和采样,也不需要外部数据存储。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目