GitHub Stars
1.5K
Forks数量
492
贡献者数量
13
许可证
Apache-2.0
收录理由
这个Java库把中文NLP项目里反复用到的那些基础代码收拢到了一起,省得每次重写一遍。里面包含词语标准化、断句、HTML标签清理、简繁体转换,以及用于快速查找的trie结构;另外还附带了汉字转拼音、布隆过滤器、基于SimHash的相似文章去重、内存搜索提示,以及词频、IDF和词类别相关度的统计。双数组trie和Viterbi算法也有实现,做分词器或搜索索引时这些都很关键。它不是一套完整流水线,更像一堆零件,需要自己动手拼装,但正是这种特性,让那些要自己定制文本处理层的团队觉得顺手。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。