#118 · 主分类: 自然语言处理与文本处理

trankit

adapters artificial-intelligence deeplearning dependency-parsing language-model lemmatization machine-learning morphological-tagging multilingual natural-language-processing nlp part-of-speech-tagging pytorch sentence-segmentation tokenization universal-dependencies xlm-roberta

Trankit 是一个轻量级、基于 Transformer 的多语言自然语言处理 Python 工具包。

项目最后更新:07/22/25

GitHub Stars

798

Forks数量

106

贡献者数量

9

许可证

Apache-2.0

收录理由

Trankit 是一套基于 Transformer 的 NLP 工具包,能处理多语言文本分析中的常见任务,包括分句、分词、词性标注、形态标注、依存句法分析以及命名实体识别。它提供的预训练流水线覆盖 56 种语言,底层使用 XLM-RoBERTa 模型,多语言模式还能自动检测输入语言,因此即使文档混杂多种语言,也无需事先指定语言即可直接处理。这个库设计得比较轻量,在笔记本电脑上就能运行,同时提供 Python API 和命令行接口,无论是写研究脚本还是嵌入到应用里都很方便。此外,你还可以用自己的数据对流水线进行微调,不必局限于现成的预训练模型。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目