#56 · 主分类: 自然语言处理与文本处理

nltk_data

corpora linguistics natural-language-processing nlp nltk

NLTK 数据

项目最后更新:07/01/26

GitHub Stars

1.8K

Forks数量

1.1K

贡献者数量

27

许可证

Apache-2.0

收录理由

NLTK 的价值很大程度上取决于它能加载的数据,而这个仓库正是那些数据的真正存放之处。它并不包含代码,而是收录了语料库、预训练模型和词表,工具包通过 nltk.download() 这样的简单调用即可获取,从布朗语料库这样的经典数据集到基础词表一应俱全。对于用 NLTK 教学或开展可重复实验的人来说,这里是一个稳定的参考点。维护者在许可方面也下了功夫:仓库自带 Apache 2.0 许可证,另外用单独文档列出了每个数据集的授权情况,省去了你在各语料库页面间逐一核对的麻烦,判断某个语料库能否商用时会轻松许多。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目