#219 · 主分类: 计算机视觉

Q-Align

aesthetic aesthetic-assessment aesthetic-visual-analysis image-quality-assessment video-quality-assessment

[ICML2024] [IQA, IAA, VQA] 用于视觉评分的全能基础模型。可高效微调至下游数据集。

项目最后更新:06/24/26

GitHub Stars

621

Forks数量

34

贡献者数量

7

许可证

Other

收录理由

Q-Align 是一个统一的视觉语言模型,用离散的文本定义等级来给图像或视频打分,覆盖图像质量、图像美学和视频质量三类任务。一个检查点就能顶替多个专用评分器,在质量管控、内容审核或美学排序这类场景里很实用。它基于 mPLUG-Owl2 架构,所以针对下游数据集做微调时效率很高,不用从头训练——当你的评分标准和公开基准不一致时,这个优势尤其明显。仓库里提供了预训练权重、模型库和 Hugging Face 在线演示,也能通过 IQA-PyTorch 指标库直接加载模型,方便你在正式接入工作流之前先跑通测试。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目