#166 · 主分类: AI工具目录与精选清单
entity-recognition-datasets
annotations
corpora
datasets
entity-extraction
entity-recognition
named-entity-recognition
natural-language-processing
ner
nlp
nlp-resources
用于命名实体识别(NER)和实体识别任务的语料库集合。这些标注数据集涵盖多种语言、领域和实体类型。
项目最后更新:07/02/26
GitHub Stars
1.6K
Forks数量
245
贡献者数量
12
许可证
MIT
收录理由
训练命名实体识别模型时,最麻烦的往往不是模型本身,而是找齐带标注的数据。这个仓库把几十个标注语料集中到了一起,省去你到处翻找的功夫。里面既有生物医学文献,也有电影和餐厅查询、新闻、社交媒体、金融申报文本,实体类型也多样,通常能找到跟你的场景比较接近的语料。它还覆盖多种语言和不同的标注体系,想检验模型跨领域泛化能力的话,这点很实用。不过要实话实说,维护者已经说明不再积极扩充这个集合,所以把它当作一个可靠的起点参考就好,别指望它持续更新。在敲定用哪个语料之前,拿它来对比各语料的内容和许可证,倒是很方便。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。