#198 · 主分类: 计算机视觉
cleanvision
自动发现图像数据集中的问题,实践以数据为中心的计算机视觉。
项目最后更新:01/08/26
GitHub Stars
1.2K
Forks数量
83
贡献者数量
20
许可证
Apache-2.0
收录理由
训练计算机视觉模型之前,先搞清楚图像文件夹里到底有什么,这步往往被忽略,而 CleanVision 就是帮你做这件事的工具。你只要把任意一个存放图片的目录交给它,它就会逐像素扫描,自动找出常见的质量问题:模糊、曝光不足或过度、近乎重复或完全重复的图片、信息量过低的画面、混进来的灰度图,以及尺寸或宽高比异常的样本。它的接口很精简,核心就是 Imagelab 对象,调用 find_issues() 做检查,再用 report() 输出一份清晰的报告,而且你可以只针对自己关心的那几种问题来筛查,不必每次都跑全量检测。它支持常见的图片格式,无论是本地文件夹、torchvision 数据集还是从 Hugging Face 拉取的数据,用法都一样,因此很容易嵌入到已有的数据处理流程里,当作一个早期的质量把关环节。如果你的痛点不是图像像素本身,而是标签标注错误,那么同门的 cleanlab 包更适合你;但若是想先把图像数据本身洗干净,CleanVision 是一个值得在项目启动时先跑一遍的快速预处理步骤。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。