#332 · 主分类: AI代理与自动化

llm-scraper

ai artificial-intelligence browser browser-automation gpt gpt-4 langchain llama llm openai playwright puppeteer scraper

使用LLMs将任何网页转化为结构化数据

项目最后更新:08/02/26

GitHub Stars

6.9K

Forks数量

453

贡献者数量

4

许可证

MIT

收录理由

传统爬虫脚本依赖CSS选择器定位元素,页面一改版就得跟着修选择器,维护起来相当繁琐。这个库换了一种思路:你只要用Zod或JSON Schema定义好想要的数据结构,它就会驱动Playwright打开真实浏览器页面,把渲染后的内容交给大语言模型,最后返回符合你定义结构的对象。它兼容多家模型供应商,从OpenAI、Anthropic到本地运行的Ollama都能用;输入格式也很灵活,可以喂预处理过的HTML、markdown、纯文本,多模态模型还能直接看截图。面对大型页面时流式输出能明显提速,另外代码生成功能可以产出可复用的Playwright脚本,对重复抓取场景省去再调一次模型的成本。对于经常要把网页内容转成JSON的团队,无论是做商品目录还是研究数据集,这套方案确实能省下大量编写脆弱选择器的功夫。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目