自然语言处理与文本处理
用于语言检测、文本分类、分词、文本规范化等核心自然语言处理任务的库和工具。
共 124 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 1 |
flair
一个非常简单的框架,用于最先进的自然语言处理(NLP) |
14.4K | 2.1K | 10/27/25 | Other |
| 2 |
compromise
简洁的自然语言处理 |
12.1K | 667 | 08/23/26 | MIT |
| 3 |
tokenizers
💥 面向研究与生产优化的快速先进分词器 |
11.0K | 1.2K | 08/27/26 | Apache-2.0 |
| 4 |
CoreNLP
CoreNLP:一套Java核心NLP工具,用于分词、句子分割、命名实体识别、句法分析、指代消解、情感分析等。 |
10.1K | 2.7K | 08/29/26 | GPL-3.0 |
| 5 |
Chinese-Word-Vectors
100+ 中文词向量 上百种预训练中文词向量 |
12.2K | 2.3K | 10/30/23 | Apache-2.0 |
| 6 |
TextBlob
简单、Pythonic 的文本处理——情感分析、词性标注、名词短语提取、翻译等。 |
9.5K | 1.2K | 08/25/26 | MIT |
| 7 |
minbpe
用于LLM分词中常见的字节对编码(BPE)算法的极简、干净代码。 |
10.7K | 1.1K | 07/01/24 | MIT |
| 8 |
nlp_chinese_corpus
大规模中文自然语言处理语料 |
9.9K | 1.6K | 02/06/26 | MIT |
| 9 |
pattern
Python的Web挖掘模块,提供抓取、自然语言处理、机器学习、网络分析和可视化工具。 |
8.9K | 1.6K | 08/05/26 | BSD-3-Clause |
| 10 |
BERTopic
利用BERT和c-TF-IDF创建易于解释的主题。 |
7.8K | 917 | 08/28/26 | MIT |
| 11 |
stanza
斯坦福NLP Python库,用于多种人类语言的词元化、句子分割、命名实体识别和句法分析。 |
7.9K | 959 | 08/29/26 | Other |
| 12 |
trafilatura
Python 和命令行工具,用于抓取网页文本和元数据:爬取、抓取、提取,输出为 CSV、JSON、HTML、MD、TXT、XML。 |
6.7K | 425 | 08/28/26 | Apache-2.0 |
| 13 |
text_classification
各种文本分类模型及更多深度学习相关内容 |
7.9K | 2.5K | 09/28/23 | MIT |
| 14 |
GPT2-Chinese
GPT2训练代码的中文版本,使用BERT分词器。 |
7.6K | 1.7K | 04/25/24 | MIT |
| 15 |
nlp.js
一个用于构建机器人的NLP库,具有实体提取、情感分析、自动语言识别等功能。 |
6.6K | 631 | 01/09/25 | MIT |
| 16 |
Parsr
将PDF、文档和图像转换为富结构化数据 |
6.2K | 318 | 03/20/26 | Apache-2.0 |
| 17 |
sensitive-word
(敏感词/违禁词/违法词/脏词。基于 DFA 算法实现的高性能 java 敏感词过滤工具框架。内置支持单词标签分类分级。请勿发布涉及政治、广告、营销、翻墙、违反国家法律法规等内容。高性能敏感词检测过滤组件,附带繁体简体互换,支持全角半角互换,汉字转拼音,模糊搜索等功能。) |
6.0K | 806 | 03/23/26 | Apache-2.0 |
| 18 |
openmed
本地优先的医疗AI:临床NER和HIPAA PII去标识化,100%设备端运行。2200+医学模型,21种语言,基于Apple MLX和Python,无需云端,患者数据不离开你的网络。Apache-2.0许可。 |
5.2K | 655 | 08/26/26 | Apache-2.0 |
| 19 |
grobid
用于从学术文档中提取信息的机器学习软件 |
5.1K | 568 | 08/29/26 | Apache-2.0 |
| 20 |
ansj_seg
中文分词,人名识别,词性标注,用户自定义词典 |
6.5K | 2.3K | 11/19/23 | Apache-2.0 |