#72 · 主分类: 自然语言处理与文本处理
instructor-embedding
embeddings
information-retrieval
language-model
prompt-retrieval
text-classification
text-clustering
text-embedding
text-evaluation
text-reranking
text-semantic-similarity
[ACL 2023] 一个嵌入器,任意任务:指令微调文本嵌入
项目最后更新:01/15/25
GitHub Stars
2.0K
Forks数量
156
贡献者数量
15
许可证
Apache-2.0
收录理由
Instructor 的设计思路很直接:你告诉模型这段文本是拿来做什么的。只需给每段文字配上一句简短的任务说明,比如“表示一个科学标题”或者“为去重检索编码这个句子”,它就会生成针对该任务的向量,而不是千篇一律的通用表示。这样一来,一个模型就能同时应付检索、聚类、分类和文本评估,而且无需任何微调。它的 encode 接口调用简单,能轻松嵌入现有 Python 代码;base、large 和 xl 三档 checkpoint 也给了你权衡速度与质量的余地。若想超越现成模型,仓库还附带了训练和 MTEB 评估代码,方便你根据自己的数据调整方案。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。