#14 · 主分类: 隐私保护与联邦数据科学

rizzo-pii

anonymization gdpr italian legal-tech llm local-first mmbert named-entity-recognition pii privacy token-classification transformers

本地优先的隐私保护:在与LLM共享之前匿名化您的文档。

项目最后更新:08/09/26

GitHub Stars

830

Forks数量

57

贡献者数量

14

许可证

MIT

收录理由

处理意大利法律或财务文件的人常陷入两难:能力最强的大模型恰恰是最不适合直接发送客户数据的。rizzo-pii 在本地 CPU 上运行一个轻量级 token 分类模型,能识别 22 类个人数据,包括 codice fiscale、partita IVA 和地籍信息——这些恰恰是英文优先的检测器容易漏掉的。每个敏感值在数据离开机器前都会被替换成稳定的占位符,而真实数据的映射关系保存在本地字典中,等云端模型返回结果后再恢复原始姓名和号码。这种可逆性正是关键:文档仍然可以用于实际工作,而简单的涂黑只会毁掉信息。律师事务所、会计师和公证员因此能在不牺牲大模型推理质量的前提下满足 GDPR 的数据最小化要求。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目