#90 · 主分类: 基础模型
bpemb
embeddings
multilingual
natural-language-processing
nlp
subword-embeddings
基于字节对编码(BPE)的275种语言预训练子词嵌入
项目最后更新:10/01/24
GitHub Stars
1.2K
Forks数量
100
贡献者数量
7
许可证
MIT
收录理由
BPEmb 为自然语言处理项目省去了自行搭建子词流程的麻烦:它内置了字节对编码(BPE)分词器,并提供了基于维基百科语料训练的 275 种语言预训练词向量。使用时只需指定语言代码和向量维度,库会自动下载对应文件,并将向量封装成 gensim 的 KeyedVectors 对象,能无缝接入现有的向量处理流程,无需转换格式。选择模型时,词汇表大小是最需要留意的参数。较小的词汇表会把词切分成更多子词,有利于处理形态变化和未登录词;较大的词汇表则能让常见词保持完整。这种权衡加上多语言覆盖,让它在多语言分类、序列标注或机器翻译等需要子词感知输入、又不想从头训练词向量的场景中相当实用。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。