#118 · 主分类: 自然语言处理与文本处理

THUOCL

chinese nlp

THUOCL(清华大学开放中文词库)

项目最后更新:04/03/23

GitHub Stars

1.1K

Forks数量

213

贡献者数量

1

许可证

MIT

收录理由

中文分词的效果很大程度上取决于喂给分词器的词典,THUOCL就是一套为此准备的人工筛选词表。它覆盖IT、财经、成语、地名、历史名人、诗词、医学、饮食、法律、车辆、动物等十一个领域,每个词条都带有文档频率值,可以根据语料中该词出现的文档数来筛选,按需调整词表的侧重点,而不是把所有词汇不加区分地混在一起。像THULAC、Jieba这类分词工具可以直接读入这些以制表符分隔的纯文本词表,让专有名词和领域术语不被切碎。这是一个数据资源而非现成程序,使用时需要把文件接入自己的分词流程,没有开箱即用的功能。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目