#30 · 主分类: AI内容阅读与聚合器

news-please

cc-news ccnews commoncrawl crawler data-gathering elasticsearch extract-articles extract-information extractor json news news-archive news-articles news-crawler news-extractor news-scraper news-websites nlp python roberta

news-please - 一个集成的网络爬虫和新闻信息提取器,开箱即用

项目最后更新:04/14/26

GitHub Stars

2.5K

Forks数量

458

贡献者数量

47

许可证

Apache-2.0

收录理由

news-please 把抓取新闻网站这件琐事变得省心不少。你只要给它一个网站根地址,它就会顺着站内链接和 RSS 源,把标题、正文、导语、作者、发布日期和语言这些信息一一抽出来,再按需写入 JSON、Elasticsearch、PostgreSQL、Redis 或者你自己指定的存储里。要是你手头已有现成的处理流程,只想单独提取文章内容,用它的库模式就够了,不必启动一次完整的爬取;而命令行模式则适合整站抓取,还能反复抓同一批文章,方便追踪内容的变更。对要搭建历史新闻语料的研究团队来说,它对接 Common Crawl 的功能尤其实用——你可以按媒体和日期在那个公开存档里筛选,省去挨个网站抓取的麻烦。底层用的是久经考验的 Scrapy、Newspaper 和 readability 组合,抽取结果稳定可靠,不是那种实验性质的解析脚本。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目