#106 · 主分类: 自然语言处理与文本处理
Familia
lda
nlp
sentence-lda
topic-modeling
topic-models
twe
工业主题建模工具包
项目最后更新:07/01/21
GitHub Stars
2.6K
Forks数量
583
贡献者数量
17
许可证
BSD-3-Clause
收录理由
百度开源的Familia把工业级主题建模能力直接送到开发者手里,省去从零训练模型的漫长周期。项目内置基于大规模语料训练好的LDA、SentenceLDA和Topical Word Embedding模型,同时提供文档主题推断与语义匹配工具,能够输出主题向量、抽取关键词、比较文档相似度,也能计算搜索词与网页之间的匹配程度。预训练模型覆盖新闻、小说和网页三类数据,如果业务语料差异较大,还可以在自有数据上重新训练。做文本分类、聚类或个性化推荐时,它给出的是可解释的主题结构,而不是一个黑盒向量。需要留意的是,仓库自2021年起基本停更,更适合当作成熟稳定的工具来用,而非期待持续迭代。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。