#82 · 主分类: 知识库与企业搜索
webclaw
快速、本地优先的LLM网页内容提取。抓取、爬取、提取结构化数据——全部基于Rust。提供CLI、REST API和MCP服务器。
项目最后更新:08/26/26
GitHub Stars
2.3K
Forks数量
232
贡献者数量
9
许可证
AGPL-3.0
收录理由
在构建大语言模型应用时,从网页里提取可用的内容往往是最让人头疼的一环。webclaw 恰好就是冲着这个痛点来的。这个项目用 Rust 编写,支持自托管,能把网页转成模型真正能消化的干净 markdown 或 JSON,而不是把塞满导航和脚本的原始 HTML 直接丢给智能体。你可以通过 CLI、REST API 或 MCP 服务器来驱动它,既能支撑实时的智能体工作流,也能用于定时把数据灌入知识库。它的爬虫能绕过机器人防护、渲染 JavaScript,还能处理 TLS 指纹识别——这些恰恰是简单抓取工具最容易栽跟头的地方。本地优先的设计让你无需注册账号就能跑起来。如果你的管线依赖新鲜或结构化的网页数据,webclaw 完全可以作为按页收费的托管提取服务的一个靠谱开源替代。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ragflow
RAGFlow 是一款领先的开源检索增强生成(RAG)引擎,将前沿 RAG 与 Agent 能力融合,为大型语言模型(LLM)打造卓越的上下文层。
Understand-Anything
教学型图表优于炫技型图表。将任意代码转化为可探索、搜索和提问的交互式知识图谱。支持Claude Code、Codex、Cursor、Copilot、Gemini CLI等。
crawl4ai
🚀🤖 Crawl4AI:开源的、对LLM友好的网页爬虫与抓取工具。别害羞,加入这里:https://discord.gg/jP8KfhDhyN
docling
为生成式AI准备文档
anything-llm
停止租用你的智能。用AnythingLLM拥有它。你需要的一切,实现强大的本地优先智能体体验。