#119 · 主分类: 自然语言处理与文本处理

small-text

active-learning deep-learning language-models llms looking-for-contributors machine-learning natural-language-processing nlp python pytorch small-language-models text-classification transformers

Python中用于文本分类的主动学习

项目最后更新:05/24/26

GitHub Stars

646

Forks数量

78

贡献者数量

10

许可证

MIT

收录理由

训练文本分类器时,标注数据往往是最贵的环节,small-text 正是冲着这个痛点来的。它把主动学习做成了现成的工具:与其随机抽一批样本去标,不如让模型自己挑出那些最能让它长进的无标注文档,你只去标这些高价值的例子。查询策略、初始化方法和停止条件都可以自由替换,而且能直接接进 scikit-learn、PyTorch 和 Hugging Face transformers 的生态里,所以同一套流程既能跑在轻量级 CPU 模型上,也能用在 GPU 加速的 transformer 上。这种模块化设计让它在受控实验和真实标注管线里都很好用,文档里还配了 notebook 和完整的示例。如果你手头没有大规模预标注语料,又需要为文档分类或主题打标快速攒出训练数据,它提供了一条实实在在降低标注成本的路径。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目