#67 · 主分类: 深度学习框架

xtuner

agent deepseek-v3 gpt-oss intern-s1 internvl kimi-k2 llm multimodal qwen3-moe qwen3-vl reinforcement-learning

为超大规模MoE模型打造的下一代训练引擎

项目最后更新:08/28/26

GitHub Stars

5.2K

Forks数量

447

贡献者数量

62

许可证

Apache-2.0

收录理由

训练大模型时,真正让人头疼的往往不是模型本身,而是背后的训练引擎怎么调都别扭。XTuner 就是冲着这个痛点来的:它是 InternLM 团队开源的 PyTorch 原生工具包,覆盖预训练、LoRA 与 QLoRA 微调,以及对文本和多模态模型的强化学习。其 V1 引擎专门面向如今科研和工业界常见的 Mixture-of-Experts(MoE)架构,能在不依赖专家并行或序列并行的情况下,用 64k 序列长度训练 200B 参数的 MoE 模型。向下伸缩同样出色,单张 8GB 显存的显卡就能微调 7B 模型。对于经常微调 Qwen、DeepSeek 等开源模型的团队来说,这是一个实际可用、维护活跃的 Megatron 和 DeepSpeed 替代选择。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目