GitHub Stars
22.4K
Forks数量
2.4K
贡献者数量
34
许可证
Other
收录理由
做自定义 GPT 或 OpenAI 助手时,最磨人的往往不是模型本身,而是整理训练素材。这个工具把这一步自动化了:给它一个起始 URL,配上链接匹配规则和针对目标内容的 CSS 选择器,它就会自动爬取站点、抽取相关文本,最后生成一个按 OpenAI 上传要求切分和标记好的单一文件。页面数量限制、跳过二进制资源、大文件拆分这些实际细节它也一并处理。运行方式灵活,既可以用命令行,也可以跑在 Docker 容器里,还能作为带 Swagger 文档的 Express API 使用。对想做一个基于自己文档或产品内容的客服、问答助手,又不想逐页手工整理资料的团队来说,相当实用。Builder.io 团队最初就是用它把自己文档喂给自定义 GPT,同样的流程搬到任何你掌控的站点上都成立。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
ragflow
RAGFlow 是一款领先的开源检索增强生成(RAG)引擎,将前沿 RAG 与 Agent 能力融合,为大型语言模型(LLM)打造卓越的上下文层。
Understand-Anything
教学型图表优于炫技型图表。将任意代码转化为可探索、搜索和提问的交互式知识图谱。支持Claude Code、Codex、Cursor、Copilot、Gemini CLI等。
crawl4ai
🚀🤖 Crawl4AI:开源的、对LLM友好的网页爬虫与抓取工具。别害羞,加入这里:https://discord.gg/jP8KfhDhyN
docling
为生成式AI准备文档
anything-llm
停止租用你的智能。用AnythingLLM拥有它。你需要的一切,实现强大的本地优先智能体体验。