自然语言处理与文本处理
用于语言检测、文本分类、分词、文本规范化等核心自然语言处理任务的库和工具。
共 124 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 81 |
mt-dnn
用于自然语言理解的多任务深度神经网络 |
2.3K | 408 | 03/07/24 | MIT |
| 82 |
Rasa_NLU_Chi
将中文自然语言转化为结构化数据 中文自然语言理解 |
1.5K | 416 | 07/30/24 | Apache-2.0 |
| 83 |
ecco
解释、分析和可视化NLP语言模型。Ecco直接在Jupyter笔记本中创建交互式可视化,解释基于Transformer的语言模型(如GPT2、BERT、RoBERTA、T5和T0)的行为。 |
2.1K | 176 | 08/15/24 | BSD-3-Clause |
| 84 |
fast-bert
用于基于BERT的NLP模型的超简单库 |
1.9K | 339 | 08/19/24 | Apache-2.0 |
| 85 |
nlpcda
一键中文数据增强包 ; NLP数据增强、bert数据增强、EDA:pip install nlpcda |
1.9K | 171 | 03/18/25 | Apache-2.0 |
| 86 |
jieba-php
"结巴"中文分词:做最好的 PHP 中文分词、中文断词组件。 / "Jieba"(中文“结巴”)中文文本分词:旨在成为最好的 PHP 中文分词模块。 |
1.4K | 257 | 12/16/25 | MIT |
| 87 |
textacy
NLP,spaCy前后 |
2.2K | 247 | 09/22/23 | Other |
| 88 |
Information-Extraction-Chinese
中文命名实体识别(IDCNN/biLSTM+CRF)与关系提取(biGRU+2ATT) |
2.3K | 798 | 02/01/24 | Other |
| 89 |
mq
类似jq的Markdown查询语言,用于命令行处理 |
1.0K | 21 | 08/30/26 | MIT |
| 90 |
transformers_tasks
⭐️ 使用transformers库的NLP算法。支持文本分类、文本生成、信息抽取、文本匹配、RLHF、SFT等。 |
2.4K | 398 | 09/29/23 | Other |
| 91 |
extractous
快速高效的非结构化数据提取。使用Rust编写,支持多种语言的绑定。 |
1.8K | 95 | 12/21/24 | Apache-2.0 |
| 92 |
lingua-rs
最准确的Rust自然语言检测库,适用于短文本和混合语言文本 |
1.1K | 63 | 03/26/26 | Apache-2.0 |
| 93 |
this-word-does-not-exist
这个词不存在 |
1.0K | 85 | 06/17/26 | MIT |
| 94 |
whatlang-rs
用于Rust的自然语言检测库。在线试用演示:https://whatlang.org/ |
1.1K | 119 | 12/24/25 | MIT |
| 95 |
clean-text
🧹 用于文本清洗的Python包 |
1.0K | 83 | 05/15/26 | Other |
| 96 |
contextualized-topic-models
一个用于运行上下文主题建模的Python包。CTMs将上下文嵌入(如BERT)与主题模型相结合,以获得连贯的主题。发表于EACL和ACL 2021(Bianchi等人)。 |
1.3K | 155 | 07/24/25 | MIT |
| 97 |
Keras-TextClassification
基于Keras的工具包,用于中文文本分类、多标签分类和句子相似度,支持多种模型(FastText、TextCNN、RCNN、BERT等)。 |
1.8K | 397 | 06/17/24 | MIT |
| 98 |
CLUECorpus2020
大规模中文预训练语料库100G |
1.0K | 83 | 02/06/26 | MIT |
| 99 |
lingua-go
Go语言最准确的自然语言检测库,适用于短文本和混合语言文本 |
1.4K | 81 | 02/06/25 | Apache-2.0 |
| 100 |
DeepMoji
用于分析情感、情绪、讽刺等的最先进的深度学习模型。 |
1.6K | 307 | 08/02/24 | MIT |