#112 · 主分类: 深度学习框架

Qwen-VL-Series-Finetune

multimodal qwen2-5-vl qwen2-vl qwen3-5 qwen3-vl vision-language vision-language-model vlm

对阿里云Qwen-VL系列进行微调的开源实现。

项目最后更新:08/22/26

GitHub Stars

2.0K

Forks数量

222

贡献者数量

14

许可证

Apache-2.0

收录理由

这个项目把阿里云通义千问的视觉语言模型整合进了一套统一微调脚本里,覆盖Qwen2-VL、Qwen3-VL以及Qwen3.5系列。训练流程直接基于HuggingFace和Liger-Kernel构建,不依赖私有框架,并且对图像和视频数据都支持SFT、DPO、GRPO等多种训练方式。对于显存或算力有限的团队,它给出了实际可用的优化手段:可以选择性地冻结部分层、通过窗口注意力补丁来降低内存占用,还能利用内核级加速减少显存需求。如果你想把Qwen模型适配到自己的数据上,而不是仅仅通过API调用现成服务,这个仓库提供了一个连贯的入手点,省去了在各处零散找代码的麻烦。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目