#5 · 主分类: 自然语言处理与文本处理
Chinese-Word-Vectors
chinese
chinese-word-segmentation
embedding
embeddings
vectors-trained
word-embeddings
100+ 中文词向量 上百种预训练中文词向量
项目最后更新:10/30/23
GitHub Stars
12.2K
Forks数量
2.3K
贡献者数量
3
许可证
Apache-2.0
收录理由
做中文自然语言处理的人,这个仓库很值得一看。里面收了一百多套预训练词向量,覆盖了从稠密的SGNS到稀疏的PPMI等多种表示,语料则来自百度百科、维基百科、人民日报、财经新闻、知乎和微博等。特征层面也考虑周全,有词、n-gram、字、偏旁和依存关系等不同选项,方便你根据具体任务挑选合适的向量,不用自己从头训练。项目还附带CA8类比推理数据集和一套评估工具,用来检验词向量在中文形态和语义关系上的表现。对于缺少大规模中文语料或GPU资源的团队来说,这是一个经过验证的起点;相关的ACL 2018论文也让方法论有了可引用的出处。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。