#197 · 主分类: 推理与本地部署
attention_sinks
将现有LLM扩展到远超原始训练长度,且内存使用恒定,无需重新训练
项目最后更新:04/10/24
GitHub Stars
735
Forks数量
44
贡献者数量
4
许可证
Apache-2.0
收录理由
长对话和流式生成跑久了,模型很容易超出预训练时的上下文窗口,生成质量会明显下滑。这个库专门解决这类问题:它实现了 Efficient Streaming Language Models 论文里的 attention-sinks 技术,让已经训练好的模型在远超原始上下文长度的情况下依然保持流畅输出,同时显存占用基本稳定,不会随序列变长而线性上涨。更实用的是,它直接嵌入了 Hugging Face transformers 的接口,你只需要从 attention_sinks 里导入 AutoModel,再设置几个参数,就能无缝替换原有模型,既不用重新训练,也不用改动生成循环。README 里还附带了多个模型的困惑度和显存对比图,方便你在投入之前先评估这种方案是否适合自己手头的任务。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。