#78 · 主分类: 自然语言处理与文本处理

natasha

embeddings morphology ner nlp python russian sentence-segmentation syntax tokenizer visualization

解决基本的俄语自然语言处理任务,为更底层的Natasha项目提供API

项目最后更新:04/13/26

GitHub Stars

1.3K

Forks数量

120

贡献者数量

20

许可证

MIT

收录理由

做俄语文本处理的人,日常那些繁琐的NLP步骤——分词、断句、词形标注、词形还原、句法分析、命名实体识别,外加基于规则的实体抽取和标注可视化——在Natasha里都能用一个Python接口搞定。它的模型压缩得很小,靠NumPy在CPU上跑推理,没有GPU资源的团队也能轻松落地。上层封装把Natasha系列的各组件统一到一个Doc对象里,几行代码就能从原始文本拿到带标注和句法结构的文档。不过要实话实说:模型是在新闻语料上调优的,换到其他领域效果会打折扣,而且README自己也提醒生产环境用户优先用底层库,而不是这个顶层API。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目