#91 · 主分类: AI代理与自动化

crawlee

apify automation crawler crawling headless headless-chrome javascript nodejs npm playwright puppeteer scraper scraping typescript web-crawler web-crawling web-scraping

一个用于Node.js的网页抓取和浏览器自动化库,用于构建可靠的爬虫并为AI、LLM、RAG或GPT提取数据。

项目最后更新:08/29/26

GitHub Stars

25.6K

Forks数量

1.6K

贡献者数量

143

许可证

Apache-2.0

收录理由

对于需要持续获取新鲜、结构化网页数据来训练或调用大模型、构建RAG索引的团队来说,Crawlee是一个很实在的选择。它作为Node.js库,把爬虫的整个流程都包揽了:维护持久的URL队列、自动轮换代理、生成模拟真人浏览的浏览器指纹,让爬虫在默认配置下就能避开多数反爬机制。抓取时既可以用Cheerio或JSDOM走原始HTTP协议追求速度,也可以切换到Playwright或Puppeteer驱动真实无头浏览器处理需要JS渲染的页面,两套方式共用同一套接口。抓取结果能写入磁盘或云端的可插拔存储。内置的重试、会话管理和扩展机制,省去了团队维护爬虫稳定性的琐碎工作。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目