#3 · 主分类: 数据目录与元数据管理
CLUEDatasetSearch
chinese
corpus
datasets
knowledge-graph
machine-reading-comprehension
machine-translation
match
ner
nlp
qa
sentiment-analysis
text-classification
text-similarity
text-summarization
搜索所有中文NLP数据集,附常用英文NLP数据集
项目最后更新:11/21/22
GitHub Stars
4.5K
Forks数量
626
贡献者数量
4
许可证
Other
收录理由
做中文NLP的人,找数据集往往是整个流程里最磨人的一环。CLUEDatasetSearch把数百个中文数据集集中在一个地方,另附一批常用英文数据集,按任务归类——命名实体识别、问答、情感分析、文本匹配、机器翻译都在其列。表格里每一条都指向原始来源,并附简短说明,交代数据的构成与出处,下载前就能掂量是否合用。项目同时提供网页端搜索工具,支持交互式筛选;也接受社区上传数据集信息,好让这份清单持续更新。它定位是发现资源的入口,不是拿来运行的程序;要找中文NLP数据,从这里起步是省事的选择。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。