#206 · 主分类: MLOps与评测
llm_training_handbook
一个开放的方法论集合,助力大型语言模型的成功训练。
项目最后更新:02/15/24
GitHub Stars
567
Forks数量
45
贡献者数量
2
许可证
Other
收录理由
这份手册是给真正动手训练大模型的人准备的,不是装个包就能用的工具。它的价值在于那些可以直接复制粘贴的脚本和命令,专门解决训练过程中会遇到的现实问题:模型并行、吞吐量优化、张量精度与数据类型选择、超参数设置、训练不稳定,以及软硬件故障排查。当训练任务卡住、发散或崩溃时,SLURM 调度和故障排查这两部分内容最值得翻出来对照。作者还附了一份姊妹篇 playbook,如果你只想要概念层面的整体认识而不想碰命令行,可以转去那里。建议把这份手册放在手边,训练跑起来的时候随时查阅。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
unsloth
本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。
LlamaFactory
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
airflow
Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台
langfuse
🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23
netron
神经网络、深度学习和机器学习模型的可视化工具