#3 · 主分类: 隐私保护与联邦数据科学

presidio

anonymization data-anonymization data-masking data-obfuscation data-privacy data-redaction de-identification guardrails image-redactor named-entity-recognition nlp personally-identifiable-information phi pii pii-detection privacy python sensitive-data spacy transformers

一个开源框架,用于检测、编辑、掩蔽和匿名化文本、图像和结构化数据中的敏感数据(PII)。支持NLP、模式匹配和可定制流水线。

项目最后更新:08/26/26

GitHub Stars

10.7K

Forks数量

1.3K

贡献者数量

208

许可证

MIT

收录理由

当数据在流向不该去的地方之前需要剥离个人身份信息时,Presidio 是一个很实在的选择。它在自由文本里识别 PII 时,会同时用上命名实体识别、正则表达式、规则判断和校验和验证,所以抓信用卡号、姓名、地点、社保号这类信息时,不依赖单一手段,漏报率更低。同一套检测核心还能处理图像,包括 DICOM 医学影像文件,以及结构化数据,一个框架就能覆盖文本、文档和表格导出。识别器是插件式的,处理流程也能按需调整,你可以自己加实体类型,或者接入外部检测模型,不必死守默认配置。它既支持 Python 和 PySpark 调用,也能通过 Docker 或 Kubernetes 部署,小到内部数据防护,大到全服务的去标识化层,都能撑起来。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目