#1 · 主分类: 数据质量与清洗
cleanlab
Cleanlab 的开源库是数据质量与机器学习处理杂乱真实世界数据和标签的标准数据为中心的人工智能包。
项目最后更新:01/13/26
GitHub Stars
11.6K
Forks数量
921
贡献者数量
55
许可证
Apache-2.0
收录理由
cleanlab 面向那些怀疑自己训练数据比表面看起来更混乱的团队。你只需训练自己的分类器,然后把预测概率和特征嵌入交给它,它就能自动标出标签错误、离群点、近似重复样本以及其他问题,省去逐条人工核验的功夫。对于在医疗记录、用户生成内容或传感器日志上构建生产级机器学习的团队来说,这把缓慢的人工审计变成了一次脚本化检查,每个新数据集都能直接跑一遍。Datalab 界面把所有问题汇总成一份报告,同时支持文本、音频、图像和表格数据。在干净标签稀缺或标注成本高昂的场景下,它能帮上大忙,因为它把人工审查的注意力引向那些模型自身的不确定性已经暗示有问题的样本上。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
DataFlow
使用最新的基于LLM的操作符和流水线轻松进行数据准备。
data-juicer
基础模型的数据处理与协作! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
qsv
极速数据处理工具包
MNBVC
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标chatGPT训练的40T数据。MNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。
Curator
面向大语言模型的可扩展数据预处理与整理工具包