#110 · 主分类: 自然语言处理与文本处理
eda_nlp
NLP数据增强,发表于EMNLP 2019
项目最后更新:03/19/23
GitHub Stars
1.7K
Forks数量
312
贡献者数量
2
许可证
Other
收录理由
手工标注文本分类数据集成本很高,手里只有几百条样本时,每多一条训练数据都弥足珍贵。这份 EDA 参考实现来自 EMNLP 2019 论文,通过四种简单的文本编辑操作——同义词替换、随机插入同义词、交换词序、随机删除若干词——为现有句子生成类似改写的变体,从而扩充训练集。整个过程不需要训练外部语言模型,只需 WordNet 同义词表和 NLTK,几分钟内就能接入现有流程,重新跑一遍分类器即可看到效果。原论文报告称,在样本量低于 500 的训练集上提升最明显,而这正是人工标注稀缺时增强技术最有价值的场景。如果希望在尝试更重的合成数据工具之前,先用一种轻量、可复现的方法扩大语料库,从这里入手是个不错的选择。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。