#3 · 主分类: 数据标注与标签工具
snorkel
一个通过弱监督快速生成训练数据的系统
项目最后更新:06/08/26
GitHub Stars
6.0K
Forks数量
859
贡献者数量
81
许可证
Apache-2.0
收录理由
在机器学习中,给训练数据打标签往往是最耗时的一环,Snorkel 直接针对这个痛点下手。它不要求你花钱雇人手工标注成千上万的样本,而是让你写出一些简单、甚至带点噪声的规则——比如正则表达式、启发式判断,或者来自外部知识的远距离监督信号。系统会先估计每条规则的准确度,以及规则之间的相互关系,再把它们的投票融合成带概率的标签,这些标签可以直接交给下游的分类模型使用。对于领域专家能说清“什么样的数据算好样本”,却抽不出几周时间去做手工标注的团队,这个思路尤其合适,像临床文本、法律文书这类人工标注又慢又贵的场景更是如此。只要你有未标注的数据,再加上几条粗略的启发式规则,Snorkel 就能把这两样东西变成可用的训练数据,这条路已经被不少项目验证过了。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
doccano
面向机器学习从业者的开源标注工具。
X-AnyLabeling
X-AnyLabeling:一款轻量、高效、统一的跨平台桌面应用,用于标注文本、图像、视频和多模态数据,结合多功能内置工具与先进的AI模型,支持灵活的多格式导出。
argilla
Argilla 是面向 AI 工程师和领域专家的协作工具,用于构建高质量数据集。
anylabeling
轻松实现AI辅助数据标注,支持YOLO、Segment Anything(SAM+SAM2/2.1+SAM3)和MobileSAM!
awesome-data-labeling
精选的 awesome 数据标注工具列表