#30 · 主分类: AI内容阅读与聚合器
news-please
news-please - 一个集成的网络爬虫和新闻信息提取器,开箱即用
项目最后更新:04/14/26
GitHub Stars
2.5K
Forks数量
458
贡献者数量
47
许可证
Apache-2.0
收录理由
news-please 把抓取新闻网站这件琐事变得省心不少。你只要给它一个网站根地址,它就会顺着站内链接和 RSS 源,把标题、正文、导语、作者、发布日期和语言这些信息一一抽出来,再按需写入 JSON、Elasticsearch、PostgreSQL、Redis 或者你自己指定的存储里。要是你手头已有现成的处理流程,只想单独提取文章内容,用它的库模式就够了,不必启动一次完整的爬取;而命令行模式则适合整站抓取,还能反复抓同一批文章,方便追踪内容的变更。对要搭建历史新闻语料的研究团队来说,它对接 Common Crawl 的功能尤其实用——你可以按媒体和日期在那个公开存档里筛选,省去挨个网站抓取的麻烦。底层用的是久经考验的 Scrapy、Newspaper 和 readability 组合,抽取结果稳定可靠,不是那种实验性质的解析脚本。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
Folo
🧡 Folo 是 AI RSS 阅读器
Vane
Vane 是一个 AI 驱动的回答引擎。
karakeep
一个可自托管的书签一切应用(链接、笔记和图片),具有基于AI的自动标签和全文搜索功能
daily
daily.dev 是个性化的开发者新闻源和社区。在浏览器新标签页或移动端获取来自全网的最佳技术内容。免费且开源。
SurfSense
开源的NotebookLM替代品。通过一个平台、API或MCP服务器,使用实时数据(Reddit、YouTube、Instagram、TikTok、Indeed、Google搜索、地图等)研究开放网络。加入我们的Discord:https://discord.gg/ejRNvftDp9