#163 · 主分类: 深度学习框架

higgsfield

cluster-management deep-learning distributed llama llama2 llm machine-learning mlops pytorch

容错、高度可扩展的GPU编排,以及专为训练数十亿到数万亿参数模型而设计的机器学习框架。

项目最后更新:05/25/24

GitHub Stars

4.1K

Forks数量

708

贡献者数量

4

许可证

Apache-2.0

收录理由

训练大语言模型时,多节点配置、启动脚本、节点故障这些琐碎环节常常让人头疼。Higgsfield把这一层编排工作收拢起来,用Python装饰器和类似Llama70b的模型构造函数替代,节点分配、ZeRO-3与全分片数据并行切分、实验排队都交给它处理。如果团队习惯在GitHub上协作,它的CI流程会很顺手:代码一推送就能触发训练,运行界面直接出现在仓库里。这套工具面向那些想要更上层分布式训练路径、又不想丢掉PyTorch和DeepSpeed已有概念的工程师。手头只有几台GPU机器、厌倦了手工拼装这些部件的人,可以把它当作一个更轻量的选择来试试。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目