#53 · 主分类: 自然语言处理与文本处理

tika-python

buffer covid-19 detection extraction memex mime nlp nlp-library nlp-machine-learning parse parser-interface python recognition text-extraction text-recognition tika-python tika-server tika-server-jar translation-interface usc

Tika-Python 是 Apache Tika™ REST 服务的 Python 绑定,允许在 Python 社区中本地调用 Tika。

项目最后更新:08/01/26

GitHub Stars

1.7K

Forks数量

249

贡献者数量

75

许可证

Apache-2.0

收录理由

在Python生态里做文本抽取,最头疼的往往不是解析逻辑本身,而是面对一堆格式各异的二进制文件——PDF、Word、表格、演示文稿,每种格式都有各自的解析库,凑在一起又乱又难维护。这个库的做法很直接:在后台启动Apache Tika的REST服务,把繁重的解析工作交给Tika完成,Python这边只需一次调用,就能同时拿到文本内容和元数据,连未知文件的MIME类型也能顺手识别出来。这种统一的解析入口,很适合作为构建搜索索引或检索流程之前的预处理步骤,省去为每种文件类型单独写解析器的麻烦。需要留意的是,它要求系统里装了Java 11或更高版本,因为库会在后台拉起Tika服务器;如果处在断网环境,官方也提供了使用本地服务器jar的配置方法,照着文档设置环境变量就能跑起来。这个项目维护了相当长时间,贡献者众多,API的稳定性经得起实际项目考验,不像一些新库那样可能频繁变动接口,用起来心里更有底。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目