#85 · 主分类: 自然语言处理与文本处理
nlpcda
一键中文数据增强包 ; NLP数据增强、bert数据增强、EDA:pip install nlpcda
项目最后更新:03/18/25
GitHub Stars
1.9K
Forks数量
171
贡献者数量
3
许可证
Apache-2.0
收录理由
这个中文NLP数据增强工具能帮助训练语料不足的项目快速生成更多样本,无需重新采集数据。通过pip即可安装,内置九种增强手段,包括随机实体替换、同义词与近音字替换、字符删除、邻近字乱序、等价字替换,还专门为BIO格式的NER数据提供了句子与标签同步增强的模式,这是多数同类工具开箱即用所不具备的。作者在细节上做了处理,日期、时间、数字等关键信息不会被破坏,生成结果能保留原句大部分语义。使用者也可以自行传入同义词表或等价字词典,方便把扰动控制在自己业务领域内。对于训练中文分类器、检索模型或实体识别器而又不想额外标注数据的团队来说,这是一个简单直接的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。