#110 · 主分类: 自然语言处理与文本处理

eda_nlp

classification cnn data-augmentation embeddings nlp position rnn sentence swap synonyms text-classification

NLP数据增强,发表于EMNLP 2019

项目最后更新:03/19/23

GitHub Stars

1.7K

Forks数量

312

贡献者数量

2

许可证

Other

收录理由

手工标注文本分类数据集成本很高,手里只有几百条样本时,每多一条训练数据都弥足珍贵。这份 EDA 参考实现来自 EMNLP 2019 论文,通过四种简单的文本编辑操作——同义词替换、随机插入同义词、交换词序、随机删除若干词——为现有句子生成类似改写的变体,从而扩充训练集。整个过程不需要训练外部语言模型,只需 WordNet 同义词表和 NLTK,几分钟内就能接入现有流程,重新跑一遍分类器即可看到效果。原论文报告称,在样本量低于 500 的训练集上提升最明显,而这正是人工标注稀缺时增强技术最有价值的场景。如果希望在尝试更重的合成数据工具之前,先用一种轻量、可复现的方法扩大语料库,从这里入手是个不错的选择。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目