#219 · 主分类: 计算机视觉
Q-Align
aesthetic
aesthetic-assessment
aesthetic-visual-analysis
image-quality-assessment
video-quality-assessment
[ICML2024] [IQA, IAA, VQA] 用于视觉评分的全能基础模型。可高效微调至下游数据集。
项目最后更新:06/24/26
GitHub Stars
621
Forks数量
34
贡献者数量
7
许可证
Other
收录理由
Q-Align 是一个统一的视觉语言模型,用离散的文本定义等级来给图像或视频打分,覆盖图像质量、图像美学和视频质量三类任务。一个检查点就能顶替多个专用评分器,在质量管控、内容审核或美学排序这类场景里很实用。它基于 mPLUG-Owl2 架构,所以针对下游数据集做微调时效率很高,不用从头训练——当你的评分标准和公开基准不一致时,这个优势尤其明显。仓库里提供了预训练权重、模型库和 Hugging Face 在线演示,也能通过 IQA-PyTorch 指标库直接加载模型,方便你在正式接入工作流之前先跑通测试。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。