#166 · 主分类: 深度学习框架
EasyLM
大型语言模型(LLM)变得简单,EasyLM 是在 JAX/Flax 中预训练、微调、评估和服务 LLM 的一站式解决方案。
项目最后更新:08/13/24
GitHub Stars
2.5K
Forks数量
259
贡献者数量
11
许可证
Apache-2.0
收录理由
EasyLM 把分布式训练里那些繁琐的细节都处理掉了,让你能直接上手那些单块加速器根本装不下的模型。它基于 JAX/Flax,借助 pjit 将权重和数据切分到多张 TPU 或 GPU 上,既支持单机多卡,也能跑在 Google Cloud TPU Pod 的多机环境里。原生支持 LLaMA 系列,代码构建在 Hugging Face 的 transformers 和 datasets 之上,用起来很顺手。OpenLLaMA 和 Koala 聊天机器人就是用这套框架训练出来的,想了解这些模型实际怎么训练的话,这里是个很好的参考。对于已经熟悉 JAX 的人来说,它提供了一条相当直接的路径,不用切换生态就能进入大规模语言模型的工作流。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。