#52 · 主分类: 基础模型

lit-llama

基于nanoGPT的LLaMA语言模型实现。支持flash attention、Int8和GPTQ 4bit量化、LoRA和LLaMA-Adapter微调、预训练。采用Apache 2.0许可证。

项目最后更新:07/01/25

GitHub Stars

6.1K

Forks数量

517

贡献者数量

35

许可证

Apache-2.0

收录理由

这个仓库可能对大多数人不直接有用,但如果你想了解LLaMA这类模型实际是怎么训练和调优的,它的代码读起来相当清爽,因为基于nanoGPT,刻意保持简洁。预训练、LoRA和LLaMA-Adapter微调、生成、flash attention、Int8或GPTQ 4-bit量化,都能在可读的Python代码中端到端追踪,并且采用Apache-2.0许可证,绕开了Meta原始代码的GPL限制。需要诚实指出的是,Lightning团队已经转向其继任者LitGPT,这个仓库不再获得更新。把它当作扎实的学习材料和实验起点是合适的,而不是一个受支持的产品。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目