#82 · 主分类: 知识库与企业搜索

webclaw

ai-agents ai-scraping apify-alternative cli crawl4ai-alternative firecrawl-alternative html-to-markdown jina-alternative llm markdown mcp mcp-server rust scraperapi-alternative scrapingbee-alternative self-hosted tls-fingerprinting web-crawler web-extraction web-scraping

快速、本地优先的LLM网页内容提取。抓取、爬取、提取结构化数据——全部基于Rust。提供CLI、REST API和MCP服务器。

项目最后更新:08/26/26

GitHub Stars

2.3K

Forks数量

232

贡献者数量

9

许可证

AGPL-3.0

收录理由

在构建大语言模型应用时,从网页里提取可用的内容往往是最让人头疼的一环。webclaw 恰好就是冲着这个痛点来的。这个项目用 Rust 编写,支持自托管,能把网页转成模型真正能消化的干净 markdown 或 JSON,而不是把塞满导航和脚本的原始 HTML 直接丢给智能体。你可以通过 CLI、REST API 或 MCP 服务器来驱动它,既能支撑实时的智能体工作流,也能用于定时把数据灌入知识库。它的爬虫能绕过机器人防护、渲染 JavaScript,还能处理 TLS 指纹识别——这些恰恰是简单抓取工具最容易栽跟头的地方。本地优先的设计让你无需注册账号就能跑起来。如果你的管线依赖新鲜或结构化的网页数据,webclaw 完全可以作为按页收费的托管提取服务的一个靠谱开源替代。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目