GitHub Stars
7.3K
Forks数量
399
贡献者数量
5
许可证
MIT
收录理由
长时间对话场景往往会让流式大语言模型力不从心:历史token的缓存不断膨胀,文本一旦超过训练长度,许多模型就开始答非所问。StreamingLLM用一个轻巧的思路同时化解了这两道难题——只保留序列开头的几个token作为注意力锚点,让Llama-2、MPT这类模型仅凭近期上下文就能持续生成连贯回复,既不需要重置KV缓存,也不会让内存无限增长。仓库里配备了可运行的代码、评估脚本,还附带一个流式聊天演示,你可以亲手体验效果,而不必只信论文里的描述。这项技术已经被TensorRT-LLM、HuggingFace Transformers以及英特尔的Transformers扩展所集成,对于需要长期运行或内存受限的部署团队来说,是个风险很低的选择。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。