#84 · 主分类: 教育与研究

gensim

data-mining data-science document-similarity fasttext gensim information-retrieval machine-learning natural-language-processing neural-network nlp python topic-modeling word-embeddings word-similarity word2vec

面向人类的主题建模

项目最后更新:11/01/25

GitHub Stars

16.5K

Forks数量

4.4K

贡献者数量

464

许可证

LGPL-2.1

收录理由

Gensim 是 Python 生态里处理主题建模和词向量的老牌库,很多人做 NLP 任务时不想搭整套深度学习框架,第一个想到的就是它。它的算法支持流式读取语料,内存占用不随数据量线性增长,所以比 RAM 大得多的文本集合也能跑得动;LDA、LSA、HDP 这些算法都有多核并行版本,用来做大规模文本的聚类和相似度检索很顺手。在高校的 NLP 课程和科研流程里,Gensim 也经常作为标准工具出现,配套的文档和 Jupyter 教程相当齐全。需要留意的是,项目目前处于稳定维护阶段,bug 修复和文档更新还在继续,但不再添加新功能。你可以把它当作一个久经考验、文档完善的成熟库来用,而不是一个还在快速演进的工具。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目