#175 · 主分类: 深度学习框架
DeepSeek-671B-SFT-Guide
DeepSeek-V3/R1 满血版 671B 全参数微调的开源解决方案,包含从训练到推理的完整代码和脚本,以及实践中积累的一些经验和结论。
项目最后更新:03/13/25
GitHub Stars
812
Forks数量
97
贡献者数量
2
许可证
Apache-2.0
收录理由
对671B参数的MoE模型做全参数微调,工程量和踩坑难度都不小,而这份指南把从训练到推理的完整过程公开写了出来,算是少见的实操参考。它在xtuner框架上扩展了DeepSeek-V3/R1的训练逻辑,提供了建模文件、训练脚本和数据处理方式,支持用DeepSpeed ZeRO数据并行加序列并行在多机集群上跑全参数SFT。作者来自中科院自动化所和北京闻歌科技,把训练和部署中遇到的坑、问题以及解决办法都记了下来,还对比了不同并行策略下的实验结果,包括显存占用和哪些配置会爆显存。推理数据的格式扩展和多轮对话的loss字段处理这些细节,能省下不少调试时间。如果你手头有H100集群,想针对特定领域的推理任务改造DeepSeek,这份实现值得作为起点参考。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。