#8 · 主分类: 数据质量与清洗
fastdup
fastdup 是一款强大且免费的工具,旨在快速从图像和视频数据集中生成有价值的见解。它有助于提升图像和标签的质量,同时显著降低数据运营成本,并具备无与伦比的可扩展性。
项目最后更新:08/23/26
GitHub Stars
1.9K
Forks数量
93
贡献者数量
23
许可证
Other
收录理由
训练视觉模型前,清洗数据集往往比训练本身更耗时。fastdup 直接针对这个痛点:把图片或视频帧所在文件夹交给它,就能自动标出重复或近似重复的样本、离群值、损坏文件,以及视觉上高度相似的聚类,让你在正式训练之前先把数据修剪干净。它不依赖逐像素比对,而是基于紧凑的相似度嵌入来工作,单机即可处理数千万张图片;生成的画廊式报告可以直观地浏览被标记的样本组,发现标签错误也无需自己编写检查脚本。对于计算机视觉工程师和小规模数据团队来说,这是对原始视觉数据做第一轮快速筛查的实用工具,能省下大量手工翻看的时间。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
cleanlab
Cleanlab 的开源库是数据质量与机器学习处理杂乱真实世界数据和标签的标准数据为中心的人工智能包。
DataFlow
使用最新的基于LLM的操作符和流水线轻松进行数据准备。
data-juicer
基础模型的数据处理与协作! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
qsv
极速数据处理工具包
MNBVC
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标chatGPT训练的40T数据。MNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。