#72 · 主分类: 自然语言处理与文本处理

instructor-embedding

embeddings information-retrieval language-model prompt-retrieval text-classification text-clustering text-embedding text-evaluation text-reranking text-semantic-similarity

[ACL 2023] 一个嵌入器,任意任务:指令微调文本嵌入

项目最后更新:01/15/25

GitHub Stars

2.0K

Forks数量

156

贡献者数量

15

许可证

Apache-2.0

收录理由

Instructor 的设计思路很直接:你告诉模型这段文本是拿来做什么的。只需给每段文字配上一句简短的任务说明,比如“表示一个科学标题”或者“为去重检索编码这个句子”,它就会生成针对该任务的向量,而不是千篇一律的通用表示。这样一来,一个模型就能同时应付检索、聚类、分类和文本评估,而且无需任何微调。它的 encode 接口调用简单,能轻松嵌入现有 Python 代码;base、large 和 xl 三档 checkpoint 也给了你权衡速度与质量的余地。若想超越现成模型,仓库还附带了训练和 MTEB 评估代码,方便你根据自己的数据调整方案。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目