#23 · 主分类: AI数据基础设施与存储

spider

ai-agent automation crawler headless-chrome rust scraping spider web-crawler web-data web-scraping

为AI代理和LLM获取网络数据 - 使用Rust实现快速、高效、可靠

项目最后更新:08/19/26

GitHub Stars

2.7K

Forks数量

284

贡献者数量

33

许可证

MIT

收录理由

Spider 是一个以并发为核心设计的 Rust 爬虫引擎,页面抓取完成后会立刻流式返回,只有在页面确实需要 JavaScript 渲染时才启动无头 Chrome,因此大多数常规抓取过程根本不会触及浏览器。它可以从单脚本平滑扩展到分布式部署,代码无需改动。项目以 Rust 库和命令行工具的形式发布,同时提供 Node 和 Python 包;当本地原型无法满足规模需求时,可选的托管云模式会自动接管代理轮换和反机器人处理。抓取结果支持导出为 Markdown、JSON 或 WARC,方便直接用于向量库摄入和站点监控。对于需要持续获取新鲜网页内容来支撑 LLM 或 RAG 管线的团队来说,这是一个扎实且面向生产环境的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目