#127 · 主分类: 深度学习框架

TinyLLaVA_Factory

large-multimodal-models llama llava nlp tinyllama transformers vision-language

小规模大型多模态模型框架

项目最后更新:07/23/26

GitHub Stars

1.0K

Forks数量

103

贡献者数量

16

许可证

Apache-2.0

收录理由

自己动手训练视觉语言模型,常常要面对为大型GPU集群设计的复杂代码库,而TinyLLaVA_Factory瞄准的是相反的方向。它用PyTorch和HuggingFace搭建了一套模块化框架,换语言主干、视觉编码器或连接器时,不用重写整个流水线。训练投入的算力也由你说了算:可以冻结基础模型,也可以全量微调,或者用LoRA/QLoRA来降低资源占用。项目本身重视结果的可复现性,模块写得很直白,对想弄清楚小型多模态模型是怎么拼起来的研究者来说,也是一个很好的学习样本。如果你打算做一个轻量的图像理解模型,又不愿意绑定企业级硬件,从这里入手会是比较稳妥的选择。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目