#13 · 主分类: 数据标注与标签工具

autolabel

anthropic-claude data-science gpt-4 huggingface-transformers langchain large-language-models llm llms machine-learning openai python

使用LLM标注、清洗和丰富文本数据集。

项目最后更新:03/05/25

GitHub Stars

2.3K

Forks数量

159

贡献者数量

19

许可证

MIT

收录理由

如果团队还在靠人工逐条标注文本样本,这个Python库能把这件事交给所选的大语言模型。你只需指向自己的数据集并选定模型,无论是GPT-4、Claude还是本地部署的模型,它都能完成标注、清理噪声数据,并通过自定义流程丰富文本内容。内置的置信度分数和错误分析功能,能帮你识别模型可能标错的条目,而不是盲目接受所有标签。对于需要反复执行标注任务或维护不断变化训练集的人来说,附带的基准测试工具相当实用,可以在确定最终方案前比较不同模型的表现。相比托管式标注界面,数据工程师和机器学习从业者若更想要对标注流程进行编程控制,这个工具正合心意。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目