自然语言处理与文本处理

用于语言检测、文本分类、分词、文本规范化等核心自然语言处理任务的库和工具。

共 124 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 41–60 项,共 124 个

排名 项目 Stars Forks
41 prose

:book: 一个用于文本处理的 Golang 库,包括分词、词性标注和命名实体提取。

3.1K 170
42 rust-bert

Rust 原生的即用型 NLP 流水线和基于 Transformer 的模型(BERT、DistilBERT、GPT2 等)

3.1K 249
43 setfit

使用Sentence Transformers实现高效少样本学习

2.8K 264
44 SimCSE

[EMNLP 2021] SimCSE:句子嵌入的简单对比学习 https://arxiv.org/abs/2104.08821

3.7K 537
45 MITIE

MITIE:信息抽取的库和工具

3.0K 532
46 gse

Go 高效多语言 NLP 和文本分词;支持英语、中文、日语等。

2.8K 232
47 snips-nlu

Snips Python库,用于从文本中提取含义

4.0K 505
48 Recognizers-Text

跨平台库,用于识别和解析多种语言的数字、单位和日期/时间。

1.8K 434
49 BERT-BiLSTM-CRF-NER

基于Google BERT微调与私有服务器服务的BiLSTM-CRF模型的NER任务Tensorflow解决方案

4.9K 1.2K
50 scattertext

scattertext:美观地可视化不同文档类型中语言的差异。

2.3K 286
51 model2vec

快速最先进的静态嵌入

2.2K 124
52 pytextrank

Python 实现的 TextRank 算法(“文本图”)用于短语提取。

2.2K 334
53 tika-python

Tika-Python 是 Apache Tika™ REST 服务的 Python 绑定,允许在 Python 社区中本地调用 Tika。

1.7K 249
54 opennlp

Apache OpenNLP

1.6K 505
55 docext

一个本地部署、无需OCR的非结构化数据提取、Markdown转换和基准测试工具包。(https://idp-leaderboard.org/)

2.1K 155
56 nltk_data

NLTK 数据

1.8K 1.1K
57 scispacy

用于科学/生物医学文档的完整spaCy管道和模型。

2.0K 257
58 budoux

一个紧凑、独立的机器学习换行工具,支持多种语言和HTML输入。

1.8K 45
59 lingua-py

最准确的Python自然语言检测库,适用于短文本和混合语言文本

1.8K 61
60 InvoiceNet

用于从发票文档中提取智能信息的深度神经网络。

2.7K 411