#30 · 主分类: 自然语言处理与文本处理
text2vec
文本向量表征工具,把文本转化为向量矩阵,实现了Word2Vec、RankBM25、Sentence-BERT、CoSENT等文本表征、文本相似度计算模型,开箱即用。
项目最后更新:02/14/26
GitHub Stars
5.0K
Forks数量
428
贡献者数量
5
许可证
Apache-2.0
收录理由
做中文语义搜索或重复内容识别时,经常需要把句子、段落转成稠密向量,text2vec 让这件事变得很顺手。它把 Word2Vec、Sentence-BERT、CoSENT 等模型收进同一个 Python 接口,想先跑个快速的字面匹配基线,或者换更重的学习型编码器,都不用自己从头搭一套。项目里提到 CoSENT 收敛更快,在中文匹配评测上比经典 SBERT 表现更好,还给出了每个模型的 QPS 和语义相似度分数,动手之前就能挑个靠谱的默认方案。预训练中文模型拿来就能用,训练代码也齐,想拿自己的数据微调也方便。对以中文为主的团队来说,这套组合往往决定了是花一个周末做原型,还是自己从头把句向量编码器接进生产环境。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。