#106 · 主分类: 自然语言处理与文本处理

Familia

lda nlp sentence-lda topic-modeling topic-models twe

工业主题建模工具包

项目最后更新:07/01/21

GitHub Stars

2.6K

Forks数量

583

贡献者数量

17

许可证

BSD-3-Clause

收录理由

百度开源的Familia把工业级主题建模能力直接送到开发者手里,省去从零训练模型的漫长周期。项目内置基于大规模语料训练好的LDA、SentenceLDA和Topical Word Embedding模型,同时提供文档主题推断与语义匹配工具,能够输出主题向量、抽取关键词、比较文档相似度,也能计算搜索词与网页之间的匹配程度。预训练模型覆盖新闻、小说和网页三类数据,如果业务语料差异较大,还可以在自有数据上重新训练。做文本分类、聚类或个性化推荐时,它给出的是可解释的主题结构,而不是一个黑盒向量。需要留意的是,仓库自2021年起基本停更,更适合当作成熟稳定的工具来用,而非期待持续迭代。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目