#125 · 主分类: 自然语言处理与文本处理
poetry
chinese-corpus
corpus-data
literature
nlp
poetry
地球上最全的华语现代诗歌语料库,3k+诗人,80K+诗歌,15M+字
项目最后更新:09/12/25
GitHub Stars
738
Forks数量
90
贡献者数量
4
许可证
MIT
收录理由
做中文自然语言处理的人常被同一个问题卡住:想找大规模、干净的文学语料来训练模型,翻遍全网也难凑齐。这个仓库把大约三千五百位诗人的八万一千多首现代诗收拢成一套结构化的数据,格式有文档说明,还附带了贡献和调整数据的脚本。对想微调语言模型、做风格分析工具,或者用计算方法研究当代诗歌的团队来说,省去了爬网页、清数据的苦活,可以直接把精力放在建模和实验上。无论是文本生成、情感分析还是文学研究,都能从这里拿到现成的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。