#38 · 主分类: 深度学习框架
LAVIS
deep-learning
deep-learning-library
image-captioning
multimodal-datasets
multimodal-deep-learning
salesforce
vision-and-language
vision-framework
vision-language-pretraining
vision-language-transformer
visual-question-anwsering
LAVIS - 语言视觉智能的一站式库
项目最后更新:06/02/26
GitHub Stars
11.3K
Forks数量
1.1K
贡献者数量
28
许可证
BSD-3-Clause
收录理由
LAVIS 是 Salesforce 开源的一个语言-视觉智能研究库,将 BLIP、InstructBLIP、ALBEF、CLIP 等预训练模型整合在统一的 Python 接口之下。用它做图像描述、视觉问答、跨模态检索或多模态分类,往往只需几行代码,省去手工搭建训练流程的麻烦。库内还附带常用的多模态数据集加载器,以及标准化的训练和评测管线,无论是复现论文结果,还是在自己的数据上做微调,都比较顺手。项目提供了详尽的文档、Jupyter 示例和基准测试套件,对想深入了解这些模型原理或动手实践的人来说,是一份不错的参考资料。不过它定位在研究而非线上服务,部署环节需要自己动手解决。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。