#128 · 主分类: 深度学习框架
surogate
光速训练/微调
项目最后更新:08/24/26
GitHub Stars
813
Forks数量
9
贡献者数量
5
许可证
Apache-2.0
收录理由
Surogate 是一个面向大语言模型训练与微调的工具,底层用 C++/CUDA 实现,外层提供 Python 接口,适合在 NVIDIA GPU 上做预训练、微调或强化学习,无论是自建机房还是云端环境都能用。它最突出的地方在于精度选择:支持 BF16、FP8 和 NVFP4,还提供 QLoRA 的在线或预量化权重方案,这样在消费级 RTX 50 系列显卡和 B200/B300 这类数据中心硬件上,可以根据显存和速度需求灵活取舍。原生 CPU 卸载功能让大模型在有限显存下也能跑,不必非得降到 QLoRA;同时支持多 GPU 和多节点 DDP 训练,以及 GRPO/DPO 强化学习,还带自适应监控、早停和学习率管理。对于想快速跑 Qwen、Llama、Gemma 等模型的开发者,内置了现成配方和命令行工具;追求 Blackwell 硬件极限吞吐的团队则可以用 FP4 路径。整体上它是一个训练框架而非推理服务,适合以产出或更新模型权重为目标的工作流。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。