#483 · 主分类: AI代理与自动化

CyberScraper-2077

ai-scraping gemini-api llm llm-scraper openai scraper web-scraper webscraping

由LLM驱动的强大网页抓取器 | OpenAI、Gemini与Ollama

项目最后更新:08/20/26

GitHub Stars

3.2K

Forks数量

356

贡献者数量

7

许可证

MIT

收录理由

如果你经常需要从网页上提取数据,这个工具能让你扔掉手写的选择器,改用对话的方式完成抓取:丢给它一个网址,说清楚你想要什么,背后的LLM(OpenAI、Gemini,或者本地跑的Ollama模型)就会帮你找到内容并整理成结构化数据,再以JSON、CSV、SQL、Excel或HTML的格式交还给你。对于做市场调研、价格监控或者积累潜在客户这类需要反复抓取数据的团队来说,它自带的Streamlit界面不需要写代码就能上手;而开发者也可以把它作为Docker服务跑起来,接进自己的处理流程。它还支持按页码范围抓取多页站点,用缓存机制减少重复调用LLM的API开销,并且针对那些会反爬的网站提供了Tor路由和隐身模式选项。需要留意的是,用本地模型时可能要花点时间调提示词,但要把乱七八糟的网页变成干净、带标签的数据,开箱即用基本没问题。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目