#186 · 主分类: 自然语言处理与文本处理

Fast_Sentence_Embeddings

cython document-similarity embeddings fasttext fse gensim gensim-model maxpooling sentence-embeddings sentence-representation sentence-similarity sif swem usif word2vec-model wordembedding

快速计算句子嵌入!

项目最后更新:03/02/23

GitHub Stars

625

Forks数量

83

贡献者数量

7

许可证

GPL-3.0

收录理由

当语料规模大到让Transformer模型力不从心,又或者手头根本没有GPU可用时,这个库能帮你用纯CPU把海量文本快速变成句向量。它直接挂在Gensim生态里,把现成的Word2Vec、FastText或GloVe词向量通过简单平均、SIF和无需监督的uSIF三种方式聚合为句子级表示。底层用Cython加速,训练时数据可以从内存搬到磁盘,再从磁盘继续处理,所以语料比内存大好几倍也能跑完,普通机器上每秒能处理几十万句。做文档相似度、聚类或检索的团队,在换用更重的神经编码器之前,拿它当快速基线非常顺手。它还自带一批预训练向量,也支持直接接入你自己的Gensim模型,省去不少配置功夫。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目