#91 · 主分类: AI代理与自动化
crawlee
一个用于Node.js的网页抓取和浏览器自动化库,用于构建可靠的爬虫并为AI、LLM、RAG或GPT提取数据。
项目最后更新:08/29/26
GitHub Stars
25.6K
Forks数量
1.6K
贡献者数量
143
许可证
Apache-2.0
收录理由
对于需要持续获取新鲜、结构化网页数据来训练或调用大模型、构建RAG索引的团队来说,Crawlee是一个很实在的选择。它作为Node.js库,把爬虫的整个流程都包揽了:维护持久的URL队列、自动轮换代理、生成模拟真人浏览的浏览器指纹,让爬虫在默认配置下就能避开多数反爬机制。抓取时既可以用Cheerio或JSDOM走原始HTTP协议追求速度,也可以切换到Playwright或Puppeteer驱动真实无头浏览器处理需要JS渲染的页面,两套方式共用同一套接口。抓取结果能写入磁盘或云端的可插拔存储。内置的重试、会话管理和扩展机制,省去了团队维护爬虫稳定性的琐碎工作。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。