#13 · 主分类: 数据标注与标签工具
autolabel
anthropic-claude
data-science
gpt-4
huggingface-transformers
langchain
large-language-models
llm
llms
machine-learning
openai
python
使用LLM标注、清洗和丰富文本数据集。
项目最后更新:03/05/25
GitHub Stars
2.3K
Forks数量
159
贡献者数量
19
许可证
MIT
收录理由
如果团队还在靠人工逐条标注文本样本,这个Python库能把这件事交给所选的大语言模型。你只需指向自己的数据集并选定模型,无论是GPT-4、Claude还是本地部署的模型,它都能完成标注、清理噪声数据,并通过自定义流程丰富文本内容。内置的置信度分数和错误分析功能,能帮你识别模型可能标错的条目,而不是盲目接受所有标签。对于需要反复执行标注任务或维护不断变化训练集的人来说,附带的基准测试工具相当实用,可以在确定最终方案前比较不同模型的表现。相比托管式标注界面,数据工程师和机器学习从业者若更想要对标注流程进行编程控制,这个工具正合心意。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。