#85 · 主分类: 自然语言处理与文本处理

nlpcda

chinese-data-augmentation chinese-eda data-augmentation nlp nlpcda

一键中文数据增强包 ; NLP数据增强、bert数据增强、EDA:pip install nlpcda

项目最后更新:03/18/25

GitHub Stars

1.9K

Forks数量

171

贡献者数量

3

许可证

Apache-2.0

收录理由

这个中文NLP数据增强工具能帮助训练语料不足的项目快速生成更多样本,无需重新采集数据。通过pip即可安装,内置九种增强手段,包括随机实体替换、同义词与近音字替换、字符删除、邻近字乱序、等价字替换,还专门为BIO格式的NER数据提供了句子与标签同步增强的模式,这是多数同类工具开箱即用所不具备的。作者在细节上做了处理,日期、时间、数字等关键信息不会被破坏,生成结果能保留原句大部分语义。使用者也可以自行传入同义词表或等价字词典,方便把扰动控制在自己业务领域内。对于训练中文分类器、检索模型或实体识别器而又不想额外标注数据的团队来说,这是一个简单直接的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目