#131 · 主分类: 深度学习框架

lmms-engine

agi large-language-models multimodal unified-multimodal-models video-generation

一个简单、统一的多模态模型训练引擎。精简、灵活,专为大规模快速开发而设计。

项目最后更新:08/06/26

GitHub Stars

824

Forks数量

38

贡献者数量

20

许可证

Apache-2.0

收录理由

这是一个面向大规模多模态模型训练与微调场景的引擎,而非开箱即用的推理模型,因此更适合那些需要自己动手训练或调整模型的团队。它构建在 PyTorch 之上,内置了从 Qwen2.5-VL、LLaVA-OneVision 这类视觉语言模型,到 WanVideo 等扩散与视频生成模型的丰富示例配置和运行脚本,省去了从零搭建训练流程的麻烦。分布式训练能力是它的核心亮点,支持 FSDP2、张量并行、序列并行,以及针对混合专家模型的专家并行,还提供融合算子来降低显存占用。无论是跨多卡扩展单一模型,还是对比不同架构的训练方案,都能直接基于现成配置起步。项目还公开了模型 FLOPs 利用率(MFU)基准数据,帮助你在投入长周期训练前评估硬件是否被高效利用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目