#7 · 主分类: 数据质量与清洗
DataProfiler
你的数据里有什么?从数据集中提取模式、统计信息和实体。
项目最后更新:08/26/26
GitHub Stars
1.6K
Forks数量
187
贡献者数量
42
许可证
Apache-2.0
收录理由
这个工具回答的是每个数据团队迟早都会碰到的问题:在真正信任一份数据集之前,你得先弄清楚它的结构,以及里面有没有敏感字段。把文件丢给它,它会自动识别格式,把 CSV、Parquet、JSON 或 AVRO 加载成 pandas DataFrame,然后生成一份包含表结构、各列统计信息和实体识别的画像报告。真正的亮点是内置的预训练深度学习模型,不管数据是结构化表格还是非结构化文本,都能标出姓名、邮箱、电话这类 PII 或 NPI 信息。如果你想换换口味,也可以自己重新训练识别器,或者干脆接入一套自定义的实体识别流程,不必被默认的标签绑住手脚。对做数据工程、数据治理和管线监控的人来说,快速画像加上敏感信息识别这个组合,能省掉大量靠猜和手工排查的时间。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
cleanlab
Cleanlab 的开源库是数据质量与机器学习处理杂乱真实世界数据和标签的标准数据为中心的人工智能包。
DataFlow
使用最新的基于LLM的操作符和流水线轻松进行数据准备。
data-juicer
基础模型的数据处理与协作! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
qsv
极速数据处理工具包
MNBVC
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标chatGPT训练的40T数据。MNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。