#3 · 主分类: 隐私保护与联邦数据科学
presidio
一个开源框架,用于检测、编辑、掩蔽和匿名化文本、图像和结构化数据中的敏感数据(PII)。支持NLP、模式匹配和可定制流水线。
项目最后更新:08/26/26
GitHub Stars
10.7K
Forks数量
1.3K
贡献者数量
208
许可证
MIT
收录理由
当数据在流向不该去的地方之前需要剥离个人身份信息时,Presidio 是一个很实在的选择。它在自由文本里识别 PII 时,会同时用上命名实体识别、正则表达式、规则判断和校验和验证,所以抓信用卡号、姓名、地点、社保号这类信息时,不依赖单一手段,漏报率更低。同一套检测核心还能处理图像,包括 DICOM 医学影像文件,以及结构化数据,一个框架就能覆盖文本、文档和表格导出。识别器是插件式的,处理流程也能按需调整,你可以自己加实体类型,或者接入外部检测模型,不必死守默认配置。它既支持 Python 和 PySpark 调用,也能通过 Docker 或 Kubernetes 部署,小到内部数据防护,大到全服务的去标识化层,都能撑起来。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。