#90 · 主分类: 基础模型

bpemb

embeddings multilingual natural-language-processing nlp subword-embeddings

基于字节对编码(BPE)的275种语言预训练子词嵌入

项目最后更新:10/01/24

GitHub Stars

1.2K

Forks数量

100

贡献者数量

7

许可证

MIT

收录理由

BPEmb 为自然语言处理项目省去了自行搭建子词流程的麻烦:它内置了字节对编码(BPE)分词器,并提供了基于维基百科语料训练的 275 种语言预训练词向量。使用时只需指定语言代码和向量维度,库会自动下载对应文件,并将向量封装成 gensim 的 KeyedVectors 对象,能无缝接入现有的向量处理流程,无需转换格式。选择模型时,词汇表大小是最需要留意的参数。较小的词汇表会把词切分成更多子词,有利于处理形态变化和未登录词;较大的词汇表则能让常见词保持完整。这种权衡加上多语言覆盖,让它在多语言分类、序列标注或机器翻译等需要子词感知输入、又不想从头训练词向量的场景中相当实用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目