#125 · 主分类: 自然语言处理与文本处理

jcseg

chinese-nlp chinese-text-segmentation chinese-word-segmentation elasticsearch-analyzer elasticsearch-tokenizer java jcseg jcseg-analyzer keywords-extraction lucene-analyzer lucene-tokenizer mmseg natural-language-processing nlp nlp-keywords-extraction opensearch-analyzer opensearch-tokenizer pos-tagging solr-plugin

一个轻量级的Java NLP框架,用于中英文分词(MMSEG),支持关键词/摘要提取,并集成Lucene、Solr、Elasticsearch、OpenSearch。

项目最后更新:09/18/23

GitHub Stars

921

Forks数量

210

贡献者数量

14

许可证

Apache-2.0

收录理由

用Java做中文搜索或文本分析时,Jcseg是个值得细看的轻量级分词引擎。它基于MMSEG算法处理中英文,提供七种切分模式,从响应快的简易模式到专为检索设计的细粒度模式,方便你按实际负载在准确率和速度之间取舍。除了分词,它还集成了基于TextRank的关键词、关键短语、关键句子提取以及文章摘要,另有一套依托词库的实体识别,能捕捉网址、邮箱、手机号、日期和人名。内置的REST API和针对Lucene、Solr、Elasticsearch、OpenSearch的现成分析器,让接入已有搜索栈几乎不用写胶水代码。自定义词库就是普通文件,支持自动热加载,当内容里包含通用分词器认不出的领域词汇时,这一点尤其管用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目