#676 · 主分类: 教育与研究

indonlu

aacl bahasa benchmark bert datasets indo4b indobert indobert-lite indobert-models indonesian indonlp indonlu nlp nlu

首个针对印尼语的大规模自然语言处理基准。我们提供多个下游任务、预训练的IndoBERT模型以及入门代码!(AACL-IJCNLP 2020)

项目最后更新:11/16/24

GitHub Stars

655

Forks数量

215

贡献者数量

6

许可证

Apache-2.0

收录理由

对于任何正在构建或评估印尼语自然语言处理系统的人来说,IndoNLU 是一个绕不开的基准资源。它整合了 12 个下游任务,涵盖情感分析、命名实体识别、问答等常见的 NLU 工作,每个任务都提供了训练集、验证集以及标签被隐藏的测试集,这样你跑出来的结果就能和论文里公布的数字直接对比。仓库里还附带了 IndoBERT 和 IndoBERT-lite 两个预训练模型,它们是在约 40 亿词的印尼语语料(Indo4B)上训练出来的,同时你也能拿到这份语料文本和用于训练的 FastText 词向量。项目给出的入门代码让你能轻松加载模型并复现已发表的结果,在你想为自己的流程做适配之前,先拿它当个可靠的基线非常方便。如果你正在做低资源语言或非英语的建模工作,这个仓库无论是用来做评测还是继续预训练,都是一份文档齐全的参考资料。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目