#12 · 主分类: 数据质量与清洗
text-dedup
一体化文本去重
项目最后更新:03/09/26
GitHub Stars
765
Forks数量
79
贡献者数量
10
许可证
Apache-2.0
收录理由
训练数据里重复或高度相似的文本是个容易被忽视的问题:它虚增语料规模,浪费计算资源,还可能让测试样本混进训练集。text-dedup 把常用的去重算法——MinHash 加 LSH、SimHash、后缀数组子串匹配、布隆过滤器——统一放在一个由 TOML 配置驱动的界面后面,你按数据特点选一种方式就行,不用自己挨个去对接底层库。它能读本地 parquet 文件和 Hugging Face 数据集,处理完写出清洗后的版本,放进大规模语料处理流程里很顺手。配置文件让每次运行都可复现,项目自带的 CORE 和 NEWS-COPY 基准测试给出了精度、召回率和耗时的具体数据,动手前心里有数。准备语料做 LLM 预训练或微调的团队,拿它当起点很合适,功能完整又独立。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
cleanlab
Cleanlab 的开源库是数据质量与机器学习处理杂乱真实世界数据和标签的标准数据为中心的人工智能包。
DataFlow
使用最新的基于LLM的操作符和流水线轻松进行数据准备。
data-juicer
基础模型的数据处理与协作! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
qsv
极速数据处理工具包
MNBVC
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标chatGPT训练的40T数据。MNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。