#186 · 主分类: 自然语言处理与文本处理
Fast_Sentence_Embeddings
cython
document-similarity
embeddings
fasttext
fse
gensim
gensim-model
maxpooling
sentence-embeddings
sentence-representation
sentence-similarity
sif
swem
usif
word2vec-model
wordembedding
快速计算句子嵌入!
项目最后更新:03/02/23
GitHub Stars
625
Forks数量
83
贡献者数量
7
许可证
GPL-3.0
收录理由
当语料规模大到让Transformer模型力不从心,又或者手头根本没有GPU可用时,这个库能帮你用纯CPU把海量文本快速变成句向量。它直接挂在Gensim生态里,把现成的Word2Vec、FastText或GloVe词向量通过简单平均、SIF和无需监督的uSIF三种方式聚合为句子级表示。底层用Cython加速,训练时数据可以从内存搬到磁盘,再从磁盘继续处理,所以语料比内存大好几倍也能跑完,普通机器上每秒能处理几十万句。做文档相似度、聚类或检索的团队,在换用更重的神经编码器之前,拿它当快速基线非常顺手。它还自带一批预训练向量,也支持直接接入你自己的Gensim模型,省去不少配置功夫。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。