#38 · 主分类: 深度学习框架

LAVIS

deep-learning deep-learning-library image-captioning multimodal-datasets multimodal-deep-learning salesforce vision-and-language vision-framework vision-language-pretraining vision-language-transformer visual-question-anwsering

LAVIS - 语言视觉智能的一站式库

项目最后更新:06/02/26

GitHub Stars

11.3K

Forks数量

1.1K

贡献者数量

28

许可证

BSD-3-Clause

收录理由

LAVIS 是 Salesforce 开源的一个语言-视觉智能研究库,将 BLIP、InstructBLIP、ALBEF、CLIP 等预训练模型整合在统一的 Python 接口之下。用它做图像描述、视觉问答、跨模态检索或多模态分类,往往只需几行代码,省去手工搭建训练流程的麻烦。库内还附带常用的多模态数据集加载器,以及标准化的训练和评测管线,无论是复现论文结果,还是在自己的数据上做微调,都比较顺手。项目提供了详尽的文档、Jupyter 示例和基准测试套件,对想深入了解这些模型原理或动手实践的人来说,是一份不错的参考资料。不过它定位在研究而非线上服务,部署环节需要自己动手解决。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目