#193 · 主分类: AI对话与Chatbot

Dialog_Corpus

chatbot corpus dataset dialog system

训练聊天机器人系统的数据集

项目最后更新:09/23/20

GitHub Stars

2.1K

Forks数量

489

贡献者数量

2

许可证

Other

收录理由

训练中文或英文聊天机器人时,最让人头疼的往往是找不到现成的真实对话数据。这个项目把散落在各处的公开语料整理到了一个索引里,每条都附上了原始链接。真正有价值的是那些注释——不同语料的质量差别很大,比如中文电影对白噪音多、问答对应不齐,ChatterBot自带的中文语料量少但干净,而英文NLP数据集可能需要机器翻译后才能给中文机器人用。列表里还专门标出了微软小冰这个据说存在但从未公开的语料,省得你去白费力气。这份东西更像一张训练数据的分布地图,而不是开箱即用的数据集。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目