#86 · 主分类: 自然语言处理与文本处理

jieba-php

chinese-text-segmentation machine-learning natural-language-processing nlp

"结巴"中文分词:做最好的 PHP 中文分词、中文断词组件。 / "Jieba"(中文“结巴”)中文文本分词:旨在成为最好的 PHP 中文分词模块。

项目最后更新:12/16/25

GitHub Stars

1.4K

Forks数量

257

贡献者数量

16

许可证

MIT

收录理由

在 PHP 生态里,要做中文分词做搜索或文本分析,成熟的选择其实不多。jieba-php 把广为人知的结巴算法带到了这个环境,而且用 Composer 就能装,省事。它提供三种切分方式:精确模式适合分析,全模式会把所有可能的词都扫出来,搜索引擎模式则把长词再切细,建倒排索引时召回率更好。遇到词典里没有的词,靠 HMM 模型加 Viterbi 解码来兜底,你也可以喂自定义词典,让某些领域专有名词不被切错。繁体中文和其他中日韩文本也能处理,还带了 TF-IDF 关键词抽取和词性标注,算是个小工具箱,不止是单纯的分词器。如果不想为了分词去调大模型,图快图便宜,这个包是挺实在的选择。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目