数据质量与清洗
用于检测和修复机器学习数据集中的标签错误、异常值及其他数据问题,以提升训练数据质量的工具。
共 11 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 1 |
cleanlab
Cleanlab 的开源库是数据质量与机器学习处理杂乱真实世界数据和标签的标准数据为中心的人工智能包。 |
11.6K | 921 | 01/13/26 | Apache-2.0 |
| 2 |
DataFlow
使用最新的基于LLM的操作符和流水线轻松进行数据准备。 |
7.8K | 1.1K | 08/18/26 | Apache-2.0 |
| 3 |
data-juicer
基础模型的数据处理与协作! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷 |
7.0K | 412 | 08/28/26 | Apache-2.0 |
| 4 |
qsv
极速数据处理工具包 |
3.8K | 107 | 08/29/26 | Other |
| 5 |
MNBVC
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标chatGPT训练的40T数据。MNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。 |
4.3K | 296 | 08/28/26 | MIT |
| 6 |
Curator
面向大语言模型的可扩展数据预处理与整理工具包 |
1.7K | 320 | 08/28/26 | Apache-2.0 |
| 7 |
DataProfiler
你的数据里有什么?从数据集中提取模式、统计信息和实体。 |
1.6K | 187 | 08/26/26 | Apache-2.0 |
| 8 |
fastdup
fastdup 是一款强大且免费的工具,旨在快速从图像和视频数据集中生成有价值的见解。它有助于提升图像和标签的质量,同时显著降低数据运营成本,并具备无与伦比的可扩展性。 |
1.9K | 93 | 08/23/26 | Other |
| 9 |
dolma
用于生成和检查OLMo预训练数据的工具与数据。 |
1.5K | 203 | 08/24/26 | Apache-2.0 |
| 10 |
spotlight
从数据框交互式探索非结构化数据集。 |
1.3K | 92 | 08/19/26 | MIT |
| 11 |
lazynlp
用于抓取和清理网页以创建大规模数据集的库。 |
2.3K | 324 | 11/11/20 | Other |