#83 · 主分类: 深度学习框架

maxtext

deepseek fine-tuning gemma2 gemma3 gpt jax large-language-models llama2 llama3 llama4 llm mistral mixtral sft

一个简单、高性能且可扩展的Jax LLM!

项目最后更新:08/30/26

GitHub Stars

2.4K

Forks数量

593

贡献者数量

263

许可证

Apache-2.0

收录理由

如果你打算用 JAX 训练或微调大语言模型,又不想从零搭建整套训练流程,MaxText 会是个很合适的起点。它内置了 Llama、Gemma、DeepSeek、Qwen、Mistral 等多个开源模型的可用参考实现,覆盖预训练和 SFT、强化学习等后训练环节,并能扩展到数万芯片规模的集群。借助 JAX 和 XLA 编译器,它不需要手工调优的内核就能获得较高的硬件利用率,同时代码保持纯 Python 编写,易读也好改。项目主要面向 Google Cloud TPU 设计,也能跑在 NVIDIA GPU 上,对于已经使用 Google Cloud 基础设施的团队来说上手很顺。由于它本身就是一份参考实现,想了解生产级 LLM 训练如何组织的人,也可以拿它当作学习材料,再据此构建自己的方案。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目