#163 · 主分类: 深度学习框架
higgsfield
cluster-management
deep-learning
distributed
llama
llama2
llm
machine-learning
mlops
pytorch
容错、高度可扩展的GPU编排,以及专为训练数十亿到数万亿参数模型而设计的机器学习框架。
项目最后更新:05/25/24
GitHub Stars
4.1K
Forks数量
708
贡献者数量
4
许可证
Apache-2.0
收录理由
训练大语言模型时,多节点配置、启动脚本、节点故障这些琐碎环节常常让人头疼。Higgsfield把这一层编排工作收拢起来,用Python装饰器和类似Llama70b的模型构造函数替代,节点分配、ZeRO-3与全分片数据并行切分、实验排队都交给它处理。如果团队习惯在GitHub上协作,它的CI流程会很顺手:代码一推送就能触发训练,运行界面直接出现在仓库里。这套工具面向那些想要更上层分布式训练路径、又不想丢掉PyTorch和DeepSpeed已有概念的工程师。手头只有几台GPU机器、厌倦了手工拼装这些部件的人,可以把它当作一个更轻量的选择来试试。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。