#124 · 主分类: 知识库与企业搜索

thepipe

document large-language-models multimodal openai pdf python scrapers scraping structured-data unstructured-data vision-language-model vision-transformer web

从棘手的文档中获取干净数据,由视觉语言模型驱动 ⚡

项目最后更新:03/25/26

GitHub Stars

1.5K

Forks数量

98

贡献者数量

4

许可证

MIT

收录理由

很多文档解析工具面对排版混乱的文件就力不从心,而 thepipe 换了一条路:它让视觉语言模型直接“读”页面,而不是靠脆弱的版式规则去猜。这样一来,PDF、网页、Word、PPT、Jupyter 笔记本,甚至视频和音频,都能被转成干净的 Markdown、表格和结构化数据,直接喂给大模型、嵌入模型或向量库。做检索管道或内部知识库的团队能省下不少工程时间——文件类型识别、版式分析、多模态抽取都在同一个包里完成,还附带分块工具以及面向 LlamaIndex 和 OpenAI 消息格式的转换。默认安装对纯 CPU 机器和 CI 环境很友好,GPU 依赖则作为可选附加项按需加载。如果你经常要把难缠的文档变成可用的模型输入,这个项目值得一试。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目