#225 · 主分类: 深度学习框架
LLM-Shearing
[ICLR 2024] Sheared LLaMA:通过结构化剪枝加速语言模型预训练
项目最后更新:03/04/24
GitHub Stars
644
Forks数量
58
贡献者数量
4
许可证
MIT
收录理由
如果团队需要一个小型语言模型,但又不想承担从头训练的全部算力开销,这个代码库提供了很实用的思路。它实现的是结构化剪枝:从 Llama-2-7B 这类已有模型上整块移除注意力头和前馈维度,再对剪枝后的结果做继续预训练,从而保留原模型的大部分能力。作者的核心论点是,剪枝一个强基座模型所花的算力,远低于从零训练一个同等规模的小模型。仓库把整套流程封装成 Composer 回调,处理了动态批次加载以及 Hugging Face 与 Composer 之间的权重转换,还发布了 1.3B 和 2.7B 的 Sheared-LLaMA 检查点以及评测脚本。这属于研究型代码,不是开箱即用的工具,配置需要自己调整,但整个配方写得很详细,可以照着走通全流程。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。