#30 · 主分类: 自然语言处理与文本处理

text2vec

embeddings nlp sentence-embeddings similarity text-similarity text2vec word2vec

文本向量表征工具,把文本转化为向量矩阵,实现了Word2Vec、RankBM25、Sentence-BERT、CoSENT等文本表征、文本相似度计算模型,开箱即用。

项目最后更新:02/14/26

GitHub Stars

5.0K

Forks数量

428

贡献者数量

5

许可证

Apache-2.0

收录理由

做中文语义搜索或重复内容识别时,经常需要把句子、段落转成稠密向量,text2vec 让这件事变得很顺手。它把 Word2Vec、Sentence-BERT、CoSENT 等模型收进同一个 Python 接口,想先跑个快速的字面匹配基线,或者换更重的学习型编码器,都不用自己从头搭一套。项目里提到 CoSENT 收敛更快,在中文匹配评测上比经典 SBERT 表现更好,还给出了每个模型的 QPS 和语义相似度分数,动手之前就能挑个靠谱的默认方案。预训练中文模型拿来就能用,训练代码也齐,想拿自己的数据微调也方便。对以中文为主的团队来说,这套组合往往决定了是花一个周末做原型,还是自己从头把句向量编码器接进生产环境。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目