#5 · 主分类: 数据质量与清洗

MNBVC

chinese chinese-language chinese-nlp chinese-simplified corpus-data nlp nlp-machine-learning

MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标chatGPT训练的40T数据。MNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。

项目最后更新:08/28/26

GitHub Stars

4.3K

Forks数量

296

贡献者数量

3

许可证

MIT

收录理由

做中文语言模型的团队都会撞上同一堵墙:网上其实有不少可用的纯文本,但零散、嘈杂,而且别的语料项目往往已经把好挖的挑走了。MNBVC正是冲着这个缺口来的,而且是在真实规模上动手——它维护着一份持续增长的中文互联网文本集,涵盖新闻、小说、论坛、wiki、台词、古诗、商品介绍、笑话、聊天记录等等,经过粗清洗后整理成txt、json、jsonl和parquet格式。项目刻意不做精细策展,维护者放弃严格索引和版权审查,为的是让下载通道保持顺畅,所以你应该把它当作原材料来用,每个文件夹里附有来源URL和网页截图,而不是一份打磨好的评测基准。目前语料总量约60TB,还在往253T的目标推进。除了数据本身,项目还配套了面向数据摄入的实用工具,包括编码检测、去重、格式校验和清洗脚本,多数团队在自己的流水线里都能直接复用。如果你正在预训练或微调中文大模型,想要实实在在的原始体量,再加上一套能帮你做清洗的管道,从这里入手是个不错的选择。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目