#47 · 主分类: 基础模型
XPretrain
多模态预训练
项目最后更新:08/28/26
GitHub Stars
510
Forks数量
36
贡献者数量
7
许可证
Other
收录理由
对于从事视觉与语言联合建模的研究者和工程师来说,这个仓库汇集了微软研究院多媒体组的多项预训练工作,代码和模型都经过了同行评议,实用性很强。里面既有面向高分辨率视频的HD-VILA,也有针对长视频的LF-VILA,还有把图像-语言预训练迁移到视频场景的CLIP-ViP,同时提供了HD-VILA-100M这样的视频语言数据集。它并不是一个开箱即用的应用,而是一套可复现的代码和检查点,方便研究者对照已发表的结果做基准测试,尤其在视频文本检索和多模态预训练基线方面很有价值。图像-语言方向的Pixel-BERT、SOHO和VisualParsing也覆盖了静态图像场景,让人能在视频和图像两种设置下横向比较不同方法。需要注意的是,微软研究许可限制了商业用途,所以更适合学术探索和原型验证,而非直接用于商业产品。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。