#16 · 主分类: 提示词工程工具

LLMLingua

[EMNLP'23, ACL'24] 加速LLM推理并增强LLM对关键信息的感知,压缩提示和KV缓存,实现高达20倍压缩且性能损失极小。

项目最后更新:04/08/26

GitHub Stars

6.6K

Forks数量

419

贡献者数量

17

许可证

MIT

收录理由

长文档和大段检索上下文会让每次API调用变慢、变贵,这是许多LLM应用迟早要面对的问题。LLMLingua在模型看到提示词之前就动手压缩,删掉冗余token,同时尽量保住关键事实,官方报告最高可达20倍压缩率,质量损失很小。它不需要单独部署成服务,通过现成的LangChain、LlamaIndex和Prompt flow集成就能直接插进现有流程,推理时还能压缩KV缓存。项目出自微软研究院,相关论文发表在EMNLP 2023和ACL 2024上,如果你想先搞清楚压缩原理再决定是否采用,这是个不错的参考。对于按token付费或者受上下文窗口限制的团队,与其大改技术栈,不如先拿自己的数据测一测它到底合不合用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目