#166 · 主分类: AI工具目录与精选清单

entity-recognition-datasets

annotations corpora datasets entity-extraction entity-recognition named-entity-recognition natural-language-processing ner nlp nlp-resources

用于命名实体识别(NER)和实体识别任务的语料库集合。这些标注数据集涵盖多种语言、领域和实体类型。

项目最后更新:07/02/26

GitHub Stars

1.6K

Forks数量

245

贡献者数量

12

许可证

MIT

收录理由

训练命名实体识别模型时,最麻烦的往往不是模型本身,而是找齐带标注的数据。这个仓库把几十个标注语料集中到了一起,省去你到处翻找的功夫。里面既有生物医学文献,也有电影和餐厅查询、新闻、社交媒体、金融申报文本,实体类型也多样,通常能找到跟你的场景比较接近的语料。它还覆盖多种语言和不同的标注体系,想检验模型跨领域泛化能力的话,这点很实用。不过要实话实说,维护者已经说明不再积极扩充这个集合,所以把它当作一个可靠的起点参考就好,别指望它持续更新。在敲定用哪个语料之前,拿它来对比各语料的内容和许可证,倒是很方便。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目