#119 · 主分类: 自然语言处理与文本处理
small-text
Python中用于文本分类的主动学习
项目最后更新:05/24/26
GitHub Stars
646
Forks数量
78
贡献者数量
10
许可证
MIT
收录理由
训练文本分类器时,标注数据往往是最贵的环节,small-text 正是冲着这个痛点来的。它把主动学习做成了现成的工具:与其随机抽一批样本去标,不如让模型自己挑出那些最能让它长进的无标注文档,你只去标这些高价值的例子。查询策略、初始化方法和停止条件都可以自由替换,而且能直接接进 scikit-learn、PyTorch 和 Hugging Face transformers 的生态里,所以同一套流程既能跑在轻量级 CPU 模型上,也能用在 GPU 加速的 transformer 上。这种模块化设计让它在受控实验和真实标注管线里都很好用,文档里还配了 notebook 和完整的示例。如果你手头没有大规模预标注语料,又需要为文档分类或主题打标快速攒出训练数据,它提供了一条实实在在降低标注成本的路径。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。