#45 · 主分类: 自然语言处理与文本处理

MITIE

c-plus-plus information-extraction java machine-learning natural-language-processing python

MITIE:信息抽取的库和工具

项目最后更新:09/28/25

GitHub Stars

3.0K

Forks数量

532

贡献者数量

38

许可证

Other

收录理由

MITIE 提供了一套从原始文本中抽取命名实体和二元关系的能力,整个过程不依赖任何云端接口,完全本地运行。它的核心是一个基于 dlib 构建的 C++ 库,融合了分布式词向量与结构化支持向量机技术来完成抽取任务。项目内置了针对英语、西班牙语和德语的预训练模型,这些模型分别基于 CoNLL 2003、ACE、Wikipedia 和 Freebase 等语料训练而成,拿到手就能直接使用,省去自己训练模型的功夫。除了 C++ 原生接口,它还提供了 Python、R、Java、C 和 MATLAB 的绑定,方便集成到不同技术栈的应用中;社区也贡献了 OCaml、.NET、PHP 和 Ruby 的封装。如果你需要处理自己的特定数据,示例程序里详细展示了如何训练自定义的抽取器和关系检测器。MITIE 采用允许商业使用的许可证,项目存在时间较长,更新节奏不快,使用时需要自己编译源码并手动下载模型文件,适合愿意投入一点维护成本的团队。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目