#56 · 主分类: 自然语言处理与文本处理
nltk_data
corpora
linguistics
natural-language-processing
nlp
nltk
NLTK 数据
项目最后更新:07/01/26
GitHub Stars
1.8K
Forks数量
1.1K
贡献者数量
27
许可证
Apache-2.0
收录理由
NLTK 的价值很大程度上取决于它能加载的数据,而这个仓库正是那些数据的真正存放之处。它并不包含代码,而是收录了语料库、预训练模型和词表,工具包通过 nltk.download() 这样的简单调用即可获取,从布朗语料库这样的经典数据集到基础词表一应俱全。对于用 NLTK 教学或开展可重复实验的人来说,这里是一个稳定的参考点。维护者在许可方面也下了功夫:仓库自带 Apache 2.0 许可证,另外用单独文档列出了每个数据集的授权情况,省去了你在各语料库页面间逐一核对的麻烦,判断某个语料库能否商用时会轻松许多。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。