#162 · 主分类: 推理与本地部署

streaming-llm

[ICLR 2024] 高效流式语言模型(使用 Attention Sinks)

项目最后更新:07/11/24

GitHub Stars

7.3K

Forks数量

399

贡献者数量

5

许可证

MIT

收录理由

长时间对话场景往往会让流式大语言模型力不从心:历史token的缓存不断膨胀,文本一旦超过训练长度,许多模型就开始答非所问。StreamingLLM用一个轻巧的思路同时化解了这两道难题——只保留序列开头的几个token作为注意力锚点,让Llama-2、MPT这类模型仅凭近期上下文就能持续生成连贯回复,既不需要重置KV缓存,也不会让内存无限增长。仓库里配备了可运行的代码、评估脚本,还附带一个流式聊天演示,你可以亲手体验效果,而不必只信论文里的描述。这项技术已经被TensorRT-LLM、HuggingFace Transformers以及英特尔的Transformers扩展所集成,对于需要长期运行或内存受限的部署团队来说,是个风险很低的选择。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目