#26 · 主分类: 深度学习框架
ms-swift
使用PEFT或全参数对600+个LLM(Qwen3.6、DeepSeek-V4、GLM-5.1、InternLM3、Llama4等)和300+个MLLM(Qwen3-VL、Qwen3-Omni、InternVL3.5、Ovis2.5、GLM4.5v、Gemma4、Llava、Phi4等)进行CPT/SFT/DPO/GRPO(AAAI 2025)。
项目最后更新:08/29/26
GitHub Stars
15.4K
Forks数量
1.6K
贡献者数量
203
许可证
Apache-2.0
收录理由
ms-swift 是 ModelScope 社区推出的一套大模型与多模态大模型微调和部署工具,覆盖了从原始权重到可上线模型的完整链路。它把预训练、指令微调、偏好对齐以及 GRPO 这类强化学习流程统一在命令行和网页界面里,省去了拼接多个训练脚本的麻烦。最突出的是它的覆盖面:数百种文本和多模态架构开箱即用,LoRA、QLoRA 等轻量方法让单卡显存压力也保持在可控范围。推理加速方面,它支持 vLLM 和 SGLang,还包含量化与评估环节,团队想用一个工具把模型从训练带到部署,会觉得很顺手。如果你本来就在用 ModelScope 的模型,它的衔接尤其自然,不过其他来源的模型也能接入。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。