#11 · 主分类: 数据质量与清洗

lazynlp

artificial-intelligence data-science language-model natural-language-processing nlp open python text-mining

用于抓取和清理网页以创建大规模数据集的库。

项目最后更新:11/11/20

GitHub Stars

2.3K

Forks数量

324

贡献者数量

7

许可证

Other

收录理由

做语言模型的人往往发现,真正的难点不在模型本身,而在于拿到一份足够大且干净的训练语料。lazynlp 直接对准这个痛点:它提供一条简洁的流程,让你抓取网页、提取纯文本、去除重复内容,最后得到一份真正可用的单语数据集。库中还附带了从 Reddit 数据转储和 Project Gutenberg 获取 URL 列表的辅助函数,以及清理样板内容和文本的实用工具。对于不想从零编写爬虫和清洗代码、又需要自行组装训练数据的工程师和研究者来说,这是个很顺手的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目