#69 · 主分类: 基础模型

KoBERT

bert korean-nlp language-model nlp pytorch transformers

韩语BERT预训练cased (KoBERT)

项目最后更新:06/14/25

GitHub Stars

1.4K

Forks数量

376

贡献者数量

13

许可证

Apache-2.0

收录理由

多语种BERT模型在处理韩语时常有精度损失,KoBERT正是为此而生:一个基于韩语维基百科500万句子训练的大小写敏感BERT模型。其词表为紧凑的8002个SentencePiece单元,模型参数量仅9200万,低于多语种基线的1.1亿。通过简单的Python包即可加载权重,除PyTorch格式外还提供ONNX和MXNet-Gluon版本,方便在ONNX Runtime中部署。仓库附带Naver情感分析和BERT-CRF命名实体识别等微调示例,为分类和序列标注任务提供了现成的起点。如果团队希望直接微调韩语原生的BERT而非处理通用多语种检查点,KoBERT是个不错的选择。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目