#20 · 主分类: 自然语言处理与文本处理

ansj_seg

ansj chinese java nlp

中文分词,人名识别,词性标注,用户自定义词典

项目最后更新:11/19/23

GitHub Stars

6.5K

Forks数量

2.3K

贡献者数量

41

许可证

Apache-2.0

收录理由

ansj_seg自2012年起就在Java生态中处理中文分词,至今仍是JVM团队值得信赖的轻量级集成方案。它融合n-Gram、CRF与HMM模型,提供多种切分模式:默认模式适合一般场景,可切换至依赖自定义词典的模式,以及面向更复杂任务的NLP专用分析。除了基础的词边界划分,它还支持中文姓名识别与词性标注,并附带关键词提取、自动摘要和自定义词典功能,让下游开发者不必从零实现这些模块。项目以Maven构件形式发布,调用只需简单的parse接口,接入成本低。如果你的项目需要快速而准确的中文分词,又不想自己搭建,不妨拿这个成熟方案在自己的数据上试试。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目