#98 · 主分类: 自然语言处理与文本处理
soynlp
用于韩语自然语言处理的Python库。提供单词提取/分词器/词性判别/预处理的功能。
项目最后更新:03/10/26
GitHub Stars
991
Forks数量
184
贡献者数量
11
许可证
LGPL-3.0
收录理由
soynlp 适合那些需要处理韩语文本、却又没有标注数据可用的场景。它不依赖预训练模型或人工标注,而是直接从你提供的文档中学习:把名词提取器或单词提取器套在一批文本上,它就能根据统计规律找出反复出现的词元。除了提取,它还涵盖分词和词性标注,并且整个库都是基于 numpy 和 scikit-learn 的纯 Python 实现,安装和部署都很省事,无论是快速原型还是批量处理都能应付。需要注意的是,这种无监督方法在同质语料上效果最好,所以项目文档也建议用主题集中的文档集来喂给提取器,比如影评或者一天的新闻文章。在这个范围内,它是个轻量又实用的韩语文本处理工具。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。