#135 · 主分类: 自然语言处理与文本处理

bookcorpus

bookcorpus corpus crawler nlp scraper

爬取 BookCorpus

项目最后更新:07/14/23

GitHub Stars

864

Forks数量

112

贡献者数量

6

许可证

MIT

收录理由

原版 BookCorpus 已不再公开分发,这给复现基于它的句子编码器与解码器实验带来了实际困难。本仓库提供了可直接运行的 Python 脚本,用于从该语料的原始来源 smashwords 抓取数据:先收集免费图书的 URL 列表,再逐本下载为纯文本;若只有 epub 格式,则自动从中抽取文字。最终生成按行分句的语料文件,可直接送入分词器使用。另有可选参数,可丢弃词数与官方统计差异过大的 epub 转换结果,避免坏数据混入。如果不想自行抓取,README 中也列出了公开的语料副本,并如实指出了每份副本的缺陷,还附有一篇讨论 BookCorpus 及其复制品已知问题的论文。需要留意的是,底层的书籍仍受版权保护,使用时须遵守来源网站的服务条款。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目