#12 · 主分类: 数据质量与清洗

text-dedup

data-processing de-duplication nlp text-processing

一体化文本去重

项目最后更新:03/09/26

GitHub Stars

765

Forks数量

79

贡献者数量

10

许可证

Apache-2.0

收录理由

训练数据里重复或高度相似的文本是个容易被忽视的问题:它虚增语料规模,浪费计算资源,还可能让测试样本混进训练集。text-dedup 把常用的去重算法——MinHash 加 LSH、SimHash、后缀数组子串匹配、布隆过滤器——统一放在一个由 TOML 配置驱动的界面后面,你按数据特点选一种方式就行,不用自己挨个去对接底层库。它能读本地 parquet 文件和 Hugging Face 数据集,处理完写出清洗后的版本,放进大规模语料处理流程里很顺手。配置文件让每次运行都可复现,项目自带的 CORE 和 NEWS-COPY 基准测试给出了精度、召回率和耗时的具体数据,动手前心里有数。准备语料做 LLM 预训练或微调的团队,拿它当起点很合适,功能完整又独立。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目