#98 · 主分类: 自然语言处理与文本处理

soynlp

korean-nlp korean-text-processing nlp postagging tokenizer word-extraction

用于韩语自然语言处理的Python库。提供单词提取/分词器/词性判别/预处理的功能。

项目最后更新:03/10/26

GitHub Stars

991

Forks数量

184

贡献者数量

11

许可证

LGPL-3.0

收录理由

soynlp 适合那些需要处理韩语文本、却又没有标注数据可用的场景。它不依赖预训练模型或人工标注,而是直接从你提供的文档中学习:把名词提取器或单词提取器套在一批文本上,它就能根据统计规律找出反复出现的词元。除了提取,它还涵盖分词和词性标注,并且整个库都是基于 numpy 和 scikit-learn 的纯 Python 实现,安装和部署都很省事,无论是快速原型还是批量处理都能应付。需要注意的是,这种无监督方法在同质语料上效果最好,所以项目文档也建议用主题集中的文档集来喂给提取器,比如影评或者一天的新闻文章。在这个范围内,它是个轻量又实用的韩语文本处理工具。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目