#109 · 主分类: 基础模型
BERTweet
BERTweet:用于英文推文的预训练语言模型(EMNLP-2020)
项目最后更新:07/22/24
GitHub Stars
609
Forks数量
55
贡献者数量
2
许可证
MIT
收录理由
BERTweet 是一个以 RoBERTa 为基底、在约 8.5 亿条推文上预训练的语言模型,专门应对英文社交媒体文本中常见的缩写、表情符号和密集链接,这些内容往往会让通用 BERT 模型表现不佳。仓库自带的 tokenizer 和归一化流程针对这类输入做了适配,并提供了 TweetNormalizer 模块,帮助用户把原始推文整理成模型可用的格式。通过 Hugging Face transformers 接口即可加载 base 或 large 版本,并针对情感分析、命名实体识别、词性标注或反讽检测等任务进行微调。对于社媒舆情分析、品牌监测或任何涉及公开对话文本的研究,它都是一个很实用的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。