#67 · 主分类: 深度学习框架
xtuner
为超大规模MoE模型打造的下一代训练引擎
项目最后更新:08/28/26
GitHub Stars
5.2K
Forks数量
447
贡献者数量
62
许可证
Apache-2.0
收录理由
训练大模型时,真正让人头疼的往往不是模型本身,而是背后的训练引擎怎么调都别扭。XTuner 就是冲着这个痛点来的:它是 InternLM 团队开源的 PyTorch 原生工具包,覆盖预训练、LoRA 与 QLoRA 微调,以及对文本和多模态模型的强化学习。其 V1 引擎专门面向如今科研和工业界常见的 Mixture-of-Experts(MoE)架构,能在不依赖专家并行或序列并行的情况下,用 64k 序列长度训练 200B 参数的 MoE 模型。向下伸缩同样出色,单张 8GB 显存的显卡就能微调 7B 模型。对于经常微调 Qwen、DeepSeek 等开源模型的团队来说,这是一个实际可用、维护活跃的 Megatron 和 DeepSpeed 替代选择。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。