#469 · 主分类: 教育与研究

VLM_survey

clip computer-vision deep-learning knowledge-distillation multi-modal-model survey transfer-learning vision-language-model

用于视觉任务的精选视觉语言模型集合

项目最后更新:10/14/25

GitHub Stars

3.1K

Forks数量

234

贡献者数量

7

许可证

Other

收录理由

这个仓库是一篇发表在TPAMI上的同行评审综述论文的配套页面,专门梳理视觉语言模型在各类视觉任务中的研究进展。仓库里的论文表格与正式发表文献采用同一套分类体系,覆盖图像分类、目标检测、语义分割等方向,每个条目都直接链接到原论文和官方项目主页,省去到处翻找的麻烦。维护者会持续合并社区提交的pull request,所以列表能跟上最新会议论文的节奏。如果你正在划定某个研究领域的范围、整理阅读清单,或者想挑一个视觉语言模型当基线跑实验,直接浏览这份整理好的表格,比自己从零搜文献要高效得多。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目