#69 · 主分类: 基础模型
KoBERT
bert
korean-nlp
language-model
nlp
pytorch
transformers
韩语BERT预训练cased (KoBERT)
项目最后更新:06/14/25
GitHub Stars
1.4K
Forks数量
376
贡献者数量
13
许可证
Apache-2.0
收录理由
多语种BERT模型在处理韩语时常有精度损失,KoBERT正是为此而生:一个基于韩语维基百科500万句子训练的大小写敏感BERT模型。其词表为紧凑的8002个SentencePiece单元,模型参数量仅9200万,低于多语种基线的1.1亿。通过简单的Python包即可加载权重,除PyTorch格式外还提供ONNX和MXNet-Gluon版本,方便在ONNX Runtime中部署。仓库附带Naver情感分析和BERT-CRF命名实体识别等微调示例,为分类和序列标注任务提供了现成的起点。如果团队希望直接微调韩语原生的BERT而非处理通用多语种检查点,KoBERT是个不错的选择。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。