#35 · 主分类: 自托管文件处理与转换

docstrange

ai document-parser document-parsing image-to-markdown llm markdown ocr pdf-parser pdf-to-json pdf-to-markdown structured-data structured-data-capture tables

从任何文档、图像、PDF、Word、PPT或URL中提取并转换数据为多种格式(Markdown、JSON、CSV、HTML),具备智能结构化数据提取和高级OCR功能。

项目最后更新:10/31/25

GitHub Stars

1.5K

Forks数量

136

贡献者数量

8

许可证

MIT

收录理由

DocStrange 把散乱复杂的原始文档变成干净、可被下游系统直接使用的文本,一个工具就能覆盖多种来源和多种出口。无论是 PDF、图片、扫描件,还是 Word、PPT、Excel 乃至网页链接,它都能转成 Markdown、JSON、CSV 或 HTML,尤其擅长把表格排版整理成 LLM 能顺畅读取的样子。遇到纯图像或扫描文档,内置的 OCR 能先把文字提出来;需要抽取特定字段时,也可以给出字段清单或 JSON 模式,让输出直奔主题,而不是吐一堆原始文本。它自带一个本地网页界面,拖拽文件即可完成转换,同时提供 Python 包和面向 Claude Desktop 的 MCP 服务器,方便接进现有工作流。如果对数据隐私有要求,完全可以在本地运行,CPU 或 GPU 都行,全程不向外发送任何数据。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目