#5 · 主分类: 自然语言处理与文本处理

Chinese-Word-Vectors

chinese chinese-word-segmentation embedding embeddings vectors-trained word-embeddings

100+ 中文词向量 上百种预训练中文词向量

项目最后更新:10/30/23

GitHub Stars

12.2K

Forks数量

2.3K

贡献者数量

3

许可证

Apache-2.0

收录理由

做中文自然语言处理的人,这个仓库很值得一看。里面收了一百多套预训练词向量,覆盖了从稠密的SGNS到稀疏的PPMI等多种表示,语料则来自百度百科、维基百科、人民日报、财经新闻、知乎和微博等。特征层面也考虑周全,有词、n-gram、字、偏旁和依存关系等不同选项,方便你根据具体任务挑选合适的向量,不用自己从头训练。项目还附带CA8类比推理数据集和一套评估工具,用来检验词向量在中文形态和语义关系上的表现。对于缺少大规模中文语料或GPU资源的团队来说,这是一个经过验证的起点;相关的ACL 2018论文也让方法论有了可引用的出处。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目