#134 · 主分类: 基础模型
beto
BETO - BERT模型的西班牙语版本
项目最后更新:10/21/23
GitHub Stars
507
Forks数量
63
贡献者数量
4
许可证
Other
收录理由
做西班牙语NLP的团队,长期缺一个用西语本身训练出来的BERT权重,多语言模型把参数摊到几十种语言上,效果难免打折。BETO就补上了这个空档:它按BERT-Base的规模,用Whole Word Masking在大规模西语语料上训练。README里给出了词性标注、命名实体识别等西语任务的基准对比,大多数情况下能和最好的多语言BERT打平甚至更好——这个证据在决定采用之前很有参考价值。模型分uncased和cased两个版本,都已经上传到Hugging Face,用Transformers库加载只需几行代码,不用自己转格式。唯一要留意的点在上生产环境之前:项目以CC BY 4.0发布,作者也提醒过训练数据的许可条款可能不允许商用,这一点得先核实清楚。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。