#164 · 主分类: 深度学习框架
LongLoRA
LongLoRA和LongAlpaca的代码和文档(ICLR 2024 Oral)
项目最后更新:08/14/24
GitHub Stars
2.7K
Forks数量
280
贡献者数量
17
许可证
Apache-2.0
收录理由
把大模型微调到能处理更长的上下文,通常意味着要在长序列上做全量训练,算力和显存开销会迅速失控。LongLoRA 用低秩更新加移位稀疏注意力来绕开这个瓶颈,只更新一小部分参数,就能把有效上下文扩展到数万 token。仓库本身是一套完整且可复现的方案:包含训练脚本、LongAlpaca-12k 指令数据集、从 7B 到 70B 的多个检查点(覆盖 8k 到 100k 上下文),还支持 QLoRA 以进一步压低显存占用,并提供 StreamingLLM 推理以应对长多轮对话。如果你已经在用 Hugging Face 生态,想在自己的数据上尝试长上下文微调,这个项目文档清晰,是很合适的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。