#108 · 主分类: 自然语言处理与文本处理

magnitude

embeddings fast fasttext gensim glove machine-learning machine-learning-library memory-efficient natural-language-processing nlp python vectors word-embeddings word2vec

快速高效的通用的向量嵌入工具包。

项目最后更新:08/03/23

GitHub Stars

1.7K

Forks数量

122

贡献者数量

4

许可证

MIT

收录理由

大多数嵌入库都要求把全部向量载入内存,词汇量一大就非常吃力。Magnitude 换了个思路:它直接从磁盘读取紧凑的二进制格式,大体积的嵌入集在普通硬件上也能顺畅运行。遇到词表外的词,它不会报错,而是给出一个可用的向量,对生僻词或新词很友好;还支持通过 HTTP 流式加载模型,不必先完整下载。如果你的 NLP 流程在用 Gensim 这类工具时碰过内存瓶颈,做文本分类、语义检索或相似度计算时,Magnitude 是个扎实的替代选择。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目