#157 · 主分类: 自然语言处理与文本处理
NLP-Cube
自然语言处理流水线 - 句子分割、分词、词形还原、词性标注和依存句法分析
项目最后更新:11/03/24
GitHub Stars
562
Forks数量
93
贡献者数量
16
许可证
Apache-2.0
收录理由
NLP-Cube 把句子切分、分词、词形还原、词性标注和依存句法分析这些常见预处理步骤整合成一条流水线,直接输出标准的 CoNLL-U 格式,后续接下游的 NLP 或信息抽取任务时几乎不用做格式转换。它自带针对 Universal Dependencies 树库所覆盖语言的预训练模型,Python 接口也很简洁:加载语言、对文档做标注,然后按词读取 lemma、UPOS、XPOS 以及依存关系等属性。由于整套标注都遵循 UD 体系,在需要跨多种语言保持标注一致性的研究或生产场景里,用起来会比较顺手。如果自带模型不适合你的领域,进阶教程里也讲了怎么训练自己的模型。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。