#35 · 主分类: 自托管文件处理与转换
docstrange
从任何文档、图像、PDF、Word、PPT或URL中提取并转换数据为多种格式(Markdown、JSON、CSV、HTML),具备智能结构化数据提取和高级OCR功能。
项目最后更新:10/31/25
GitHub Stars
1.5K
Forks数量
136
贡献者数量
8
许可证
MIT
收录理由
DocStrange 把散乱复杂的原始文档变成干净、可被下游系统直接使用的文本,一个工具就能覆盖多种来源和多种出口。无论是 PDF、图片、扫描件,还是 Word、PPT、Excel 乃至网页链接,它都能转成 Markdown、JSON、CSV 或 HTML,尤其擅长把表格排版整理成 LLM 能顺畅读取的样子。遇到纯图像或扫描文档,内置的 OCR 能先把文字提出来;需要抽取特定字段时,也可以给出字段清单或 JSON 模式,让输出直奔主题,而不是吐一堆原始文本。它自带一个本地网页界面,拖拽文件即可完成转换,同时提供 Python 包和面向 Claude Desktop 的 MCP 服务器,方便接进现有工作流。如果对数据隐私有要求,完全可以在本地运行,CPU 或 GPU 都行,全程不向外发送任何数据。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。