自然语言处理与文本处理

用于语言检测、文本分类、分词、文本规范化等核心自然语言处理任务的库和工具。

共 124 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 1–20 项,共 124 个

排名 项目 Stars Forks
1 flair

一个非常简单的框架,用于最先进的自然语言处理(NLP)

14.4K 2.1K
2 compromise

简洁的自然语言处理

12.1K 667
3 tokenizers

💥 面向研究与生产优化的快速先进分词器

11.0K 1.2K
4 CoreNLP

CoreNLP:一套Java核心NLP工具,用于分词、句子分割、命名实体识别、句法分析、指代消解、情感分析等。

10.1K 2.7K
5 Chinese-Word-Vectors

100+ 中文词向量 上百种预训练中文词向量

12.2K 2.3K
6 TextBlob

简单、Pythonic 的文本处理——情感分析、词性标注、名词短语提取、翻译等。

9.5K 1.2K
7 minbpe

用于LLM分词中常见的字节对编码(BPE)算法的极简、干净代码。

10.7K 1.1K
8 nlp_chinese_corpus

大规模中文自然语言处理语料

9.9K 1.6K
9 pattern

Python的Web挖掘模块,提供抓取、自然语言处理、机器学习、网络分析和可视化工具。

8.9K 1.6K
10 BERTopic

利用BERT和c-TF-IDF创建易于解释的主题。

7.8K 917
11 stanza

斯坦福NLP Python库,用于多种人类语言的词元化、句子分割、命名实体识别和句法分析。

7.9K 959
12 trafilatura

Python 和命令行工具,用于抓取网页文本和元数据:爬取、抓取、提取,输出为 CSV、JSON、HTML、MD、TXT、XML。

6.7K 425
13 text_classification

各种文本分类模型及更多深度学习相关内容

7.9K 2.5K
14 GPT2-Chinese

GPT2训练代码的中文版本,使用BERT分词器。

7.6K 1.7K
15 nlp.js

一个用于构建机器人的NLP库,具有实体提取、情感分析、自动语言识别等功能。

6.6K 631
16 Parsr

将PDF、文档和图像转换为富结构化数据

6.2K 318
17 sensitive-word

(敏感词/违禁词/违法词/脏词。基于 DFA 算法实现的高性能 java 敏感词过滤工具框架。内置支持单词标签分类分级。请勿发布涉及政治、广告、营销、翻墙、违反国家法律法规等内容。高性能敏感词检测过滤组件,附带繁体简体互换,支持全角半角互换,汉字转拼音,模糊搜索等功能。)

6.0K 806
18 openmed

本地优先的医疗AI:临床NER和HIPAA PII去标识化,100%设备端运行。2200+医学模型,21种语言,基于Apple MLX和Python,无需云端,患者数据不离开你的网络。Apache-2.0许可。

5.2K 654
19 grobid

用于从学术文档中提取信息的机器学习软件

5.1K 568
20 ansj_seg

中文分词,人名识别,词性标注,用户自定义词典

6.5K 2.3K
< 上一页
/ 7
下一页 >