#10 · 主分类: AI数据基础设施与存储

crawlee-python

apify automation beautifulsoup crawler crawling headless headless-chrome parsel pip playwright python scraper scraping selenium web-crawler web-crawling web-scraping

用于网页抓取和浏览器自动化的Python库,为AI、LLM、RAG和GPT提取数据。

项目最后更新:08/28/26

GitHub Stars

9.5K

Forks数量

800

贡献者数量

51

许可证

Apache-2.0

收录理由

Crawlee 是一套面向 Python 的网页抓取与浏览器自动化库,把爬虫开发中那些琐碎又关键的底层环节——请求排队、重试、会话管理、代理轮换——都封装好了。你只需要专注写提取逻辑,不必从零搭建整套抓取机制。它能直接抓取 HTML、PDF、图片以及其他文件,为 LLM、RAG 或分析类应用供数;解析层既支持轻量的 Parsel 和 BeautifulSoup,也能通过 Playwright 做完整的浏览器自动化,有头或无头模式都行。抓取结果会落到机器可读的存储后端,后续接入下游处理非常顺手。默认配置下,爬虫的请求特征已经接近真人操作,能绕过不少现代反爬机制;如果默认设置不够用,丰富的配置项也足够你按需调整。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目