#47 · 主分类: 基础模型
PhoBERT
bert
bert-embeddings
deep-learning
fairseq
language-models
named-entity-recognition
natural-language-inference
ner
nli
part-of-speech-tagging
phobert
pos-tagging
python3
rdrsegmenter
roberta
transformers
transformers-library
vietnamese
vietnamese-nlp
vncorenlp
PhoBERT:越南语预训练语言模型(EMNLP-2020 Findings)
项目最后更新:08/04/26
GitHub Stars
807
Forks数量
113
贡献者数量
1
许可证
MIT
收录理由
对于越南语自然语言处理项目,PhoBERT 提供了一个无需自行预训练即可上手的强力起点。其 base 和 large 两个版本遵循 RoBERTa 的训练方案,在大约 20GB 的维基百科和新闻文本上完成预训练,当时在词性标注、依存句法分析、命名实体识别和自然语言推理四项下游任务上刷新了最优成绩。两个尺寸的模型都能通过 Hugging Face transformers 库直接加载,微调只需几行代码。需要留意的是分词器:它要求输入已经过词切分,因此多数使用者会先用 VnCoreNLP 的切词工具处理原始文本。这样的设计让它很适合用来构建越南语分类器、命名实体识别系统或检索向量。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。