#10 · 主分类: AI数据基础设施与存储
crawlee-python
用于网页抓取和浏览器自动化的Python库,为AI、LLM、RAG和GPT提取数据。
项目最后更新:08/28/26
GitHub Stars
9.5K
Forks数量
800
贡献者数量
51
许可证
Apache-2.0
收录理由
Crawlee 是一套面向 Python 的网页抓取与浏览器自动化库,把爬虫开发中那些琐碎又关键的底层环节——请求排队、重试、会话管理、代理轮换——都封装好了。你只需要专注写提取逻辑,不必从零搭建整套抓取机制。它能直接抓取 HTML、PDF、图片以及其他文件,为 LLM、RAG 或分析类应用供数;解析层既支持轻量的 Parsel 和 BeautifulSoup,也能通过 Playwright 做完整的浏览器自动化,有头或无头模式都行。抓取结果会落到机器可读的存储后端,后续接入下游处理非常顺手。默认配置下,爬虫的请求特征已经接近真人操作,能绕过不少现代反爬机制;如果默认设置不够用,丰富的配置项也足够你按需调整。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ClickHouse
ClickHouse® 是一个实时分析数据库管理系统
simdjson
每秒解析数GB的JSON:被Facebook/Meta Velox、Node.js运行时、ClickHouse、WatermelonDB、Apache Doris、Milvus、StarRocks使用
gun
开源网络安全协议,用于同步去中心化图数据。
emqx
为AI、IoT、IIoT和联网车辆提供最可扩展且可靠的MQTT broker
server
MariaDB服务器是MySQL服务器的社区开发分支。由原MySQL团队核心成员发起,MariaDB积极与外部开发者合作,提供业界功能最丰富、稳定且许可合理的开源SQL服务器。