#11 · 主分类: 数据质量与清洗
lazynlp
用于抓取和清理网页以创建大规模数据集的库。
项目最后更新:11/11/20
GitHub Stars
2.3K
Forks数量
324
贡献者数量
7
许可证
Other
收录理由
做语言模型的人往往发现,真正的难点不在模型本身,而在于拿到一份足够大且干净的训练语料。lazynlp 直接对准这个痛点:它提供一条简洁的流程,让你抓取网页、提取纯文本、去除重复内容,最后得到一份真正可用的单语数据集。库中还附带了从 Reddit 数据转储和 Project Gutenberg 获取 URL 列表的辅助函数,以及清理样板内容和文本的实用工具。对于不想从零编写爬虫和清洗代码、又需要自行组装训练数据的工程师和研究者来说,这是个很顺手的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
cleanlab
Cleanlab 的开源库是数据质量与机器学习处理杂乱真实世界数据和标签的标准数据为中心的人工智能包。
DataFlow
使用最新的基于LLM的操作符和流水线轻松进行数据准备。
data-juicer
基础模型的数据处理与协作! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
qsv
极速数据处理工具包
MNBVC
MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标chatGPT训练的40T数据。MNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。