#133 · 主分类: 自然语言处理与文本处理

uniem

embeddings huggingface nlp sentence-embeddings sentence-transformers

统一嵌入模型

项目最后更新:09/01/23

GitHub Stars

873

Forks数量

72

贡献者数量

6

许可证

Apache-2.0

收录理由

中文团队在寻找文本嵌入模型时,常常苦于找不到与英文生态对等的好选择。uniem 项目在 Hugging Face 上发布了完整的 M3E 模型系列,并且这些模型与 sentence-transformers 完全兼容——你只需要把已有的 SentenceTransformer 代码中的模型名换成 M3E,其余部分无需改动即可继续运行。项目自带的 FineTuner 更进一步,当通用嵌入在特定领域任务上表现不佳时,你可以用几行代码对 M3E、text2vec 甚至 GPT 风格的模型进行微调,让它们贴合自己的数据。另外,uniem 还提供了 MTEB-zh 评测工具,能够在多个中文数据集上跑分类与检索基准测试,用实测分数代替主观感受来比较不同模型。对于正在为中文内容构建语义搜索、RAG 或文本分类系统的团队来说,这套工具链相当顺手。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目