#133 · 主分类: 知识库与企业搜索
chatWeb
ChatWeb可以抓取网页,读取PDF、DOCX、TXT,提取主要内容,然后基于内容回答你的问题,或总结要点。
项目最后更新:05/25/26
GitHub Stars
916
Forks数量
137
贡献者数量
4
许可证
MIT
收录理由
chatWeb 让你能把一整个文件夹的文档变成可以提问的对象,而且不用把原始文件交给第三方服务。无论是网页、PDF、Word 还是纯文本,它都会先去掉页面上的噪声,把有意义的段落切分并嵌入到本地的向量存储里——可以选 FAISS,也可以选带 pgvector 的 Postgres——然后只基于这些材料来回答你的问题,或者帮你提炼出核心要点。对于研究阅读、合同或政策文件,以及团队里经常被反复追问的那堆资料,它是个很轻量的解决方案。它还有个不错的细节:检索用的向量是从抽取出的关键词构建的,而不是直接拿用户的原始问题去做向量化,这样一来抓回来的段落往往更相关。你可以通过命令行、API 或者网页界面来使用它,也提供了 Colab 和 Docker 的入口,所以先在少量语料上试试水,之后再扩展到更大的知识库,都挺方便。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ragflow
RAGFlow 是一款领先的开源检索增强生成(RAG)引擎,将前沿 RAG 与 Agent 能力融合,为大型语言模型(LLM)打造卓越的上下文层。
Understand-Anything
教学型图表优于炫技型图表。将任意代码转化为可探索、搜索和提问的交互式知识图谱。支持Claude Code、Codex、Cursor、Copilot、Gemini CLI等。
crawl4ai
🚀🤖 Crawl4AI:开源的、对LLM友好的网页爬虫与抓取工具。别害羞,加入这里:https://discord.gg/jP8KfhDhyN
docling
为生成式AI准备文档
anything-llm
停止租用你的智能。用AnythingLLM拥有它。你需要的一切,实现强大的本地优先智能体体验。