#109 · 主分类: 基础模型

BERTweet

bert bertweet bertweet-covid19 covid covid-19 covid19 english english-tweets fairseq irony-detection language-model named-entity-recognition ner part-of-speech-tagging python3 roberta sentiment-analysis text-classification transformers

BERTweet:用于英文推文的预训练语言模型(EMNLP-2020)

项目最后更新:07/22/24

GitHub Stars

609

Forks数量

55

贡献者数量

2

许可证

MIT

收录理由

BERTweet 是一个以 RoBERTa 为基底、在约 8.5 亿条推文上预训练的语言模型,专门应对英文社交媒体文本中常见的缩写、表情符号和密集链接,这些内容往往会让通用 BERT 模型表现不佳。仓库自带的 tokenizer 和归一化流程针对这类输入做了适配,并提供了 TweetNormalizer 模块,帮助用户把原始推文整理成模型可用的格式。通过 Hugging Face transformers 接口即可加载 base 或 large 版本,并针对情感分析、命名实体识别、词性标注或反讽检测等任务进行微调。对于社媒舆情分析、品牌监测或任何涉及公开对话文本的研究,它都是一个很实用的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目