#381 · 主分类: AI工具目录与精选清单
NLP_bahasa_resources
bahasa-indonesia
corpus
corpus-linguistics
dataset
indonesian
indonesian-language
library
natural-language-processing
nlp
nlp-bahasa-resources
packages
sentiment-analysis
sentiment-analysis-dataset
印尼语自然语言处理的数据集和可用库资源精选列表
项目最后更新:02/17/23
GitHub Stars
574
Forks数量
144
贡献者数量
3
许可证
MIT
收录理由
做印尼语自然语言处理,最麻烦的往往不是模型本身,而是散落在各个 GitHub 仓库和 Hugging Face 数据集里的语料与工具。这份索引按任务把资源归拢起来,命名实体识别、词性标注、问答、文本摘要、仇恨言论检测都能按图索骥,很快找到对口的语料或库。词典部分尤其难得,情感词典、俚语、词根、停用词,还有按姓名判断性别和地区的列表,这些在别处很难一次找齐。项目还附带了预训练模型、可直接调用的库、拼写纠正工具和 Twitter 抓取脚本,研究或产品开发都能从这里起步。它是一张地图,不是单一工具,动手之前先拿它比较候选数据集和包,能省下不少试错时间。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。