#3 · 主分类: 数据标注与标签工具

snorkel

ai data-augmentation data-science data-slicing labeling machine-learning python snorkel training-data weak-supervision

一个通过弱监督快速生成训练数据的系统

项目最后更新:06/08/26

GitHub Stars

6.0K

Forks数量

859

贡献者数量

81

许可证

Apache-2.0

收录理由

在机器学习中,给训练数据打标签往往是最耗时的一环,Snorkel 直接针对这个痛点下手。它不要求你花钱雇人手工标注成千上万的样本,而是让你写出一些简单、甚至带点噪声的规则——比如正则表达式、启发式判断,或者来自外部知识的远距离监督信号。系统会先估计每条规则的准确度,以及规则之间的相互关系,再把它们的投票融合成带概率的标签,这些标签可以直接交给下游的分类模型使用。对于领域专家能说清“什么样的数据算好样本”,却抽不出几周时间去做手工标注的团队,这个思路尤其合适,像临床文本、法律文书这类人工标注又慢又贵的场景更是如此。只要你有未标注的数据,再加上几条粗略的启发式规则,Snorkel 就能把这两样东西变成可用的训练数据,这条路已经被不少项目验证过了。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目