#123 · 主分类: 自然语言处理与文本处理
kcws
深度学习中文分词
项目最后更新:05/18/18
GitHub Stars
2.1K
Forks数量
630
贡献者数量
5
许可证
Other
收录理由
中文文本没有天然的词边界,分词往往是中文自然语言处理链条上最先要解决的一环,kcws 正是为此设计的。它采用 BiLSTM+CRF 与 IDCNN 序列模型,仓库里提供了训练好的 word2vec 词向量、词性标注模型,以及基于 Bazel 构建的后端服务,可以直接对外提供分词接口。README 把整个流程写得很完整,从标注语料的整理、字符向量的训练,到模型训练、冻结图导出,再到启动 web 服务,每一步都有命令可循。自定义词典在解码阶段生效,给领域词条配上权重,分词器就会保留这些词而不再拆开。无论是想复现论文结果,还是要把分词和词性标注适配到自己手里的中文语料,模型文件、训练脚本和可运行的服务都集中在这一个项目里,省去不少拼凑的功夫。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。