自然语言处理与文本处理

用于语言检测、文本分类、分词、文本规范化等核心自然语言处理任务的库和工具。

共 124 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 81–100 项,共 124 个

排名 项目 Stars Forks
81 mt-dnn

用于自然语言理解的多任务深度神经网络

2.3K 408
82 Rasa_NLU_Chi

将中文自然语言转化为结构化数据 中文自然语言理解

1.5K 416
83 ecco

解释、分析和可视化NLP语言模型。Ecco直接在Jupyter笔记本中创建交互式可视化,解释基于Transformer的语言模型(如GPT2、BERT、RoBERTA、T5和T0)的行为。

2.1K 176
84 fast-bert

用于基于BERT的NLP模型的超简单库

1.9K 339
85 nlpcda

一键中文数据增强包 ; NLP数据增强、bert数据增强、EDA:pip install nlpcda

1.9K 171
86 jieba-php

"结巴"中文分词:做最好的 PHP 中文分词、中文断词组件。 / "Jieba"(中文“结巴”)中文文本分词:旨在成为最好的 PHP 中文分词模块。

1.4K 257
87 textacy

NLP,spaCy前后

2.2K 247
88 Information-Extraction-Chinese

中文命名实体识别(IDCNN/biLSTM+CRF)与关系提取(biGRU+2ATT)

2.3K 798
89 mq

类似jq的Markdown查询语言,用于命令行处理

1.0K 21
90 transformers_tasks

⭐️ 使用transformers库的NLP算法。支持文本分类、文本生成、信息抽取、文本匹配、RLHF、SFT等。

2.4K 398
91 extractous

快速高效的非结构化数据提取。使用Rust编写,支持多种语言的绑定。

1.8K 95
92 lingua-rs

最准确的Rust自然语言检测库,适用于短文本和混合语言文本

1.1K 63
93 this-word-does-not-exist

这个词不存在

1.0K 85
94 whatlang-rs

用于Rust的自然语言检测库。在线试用演示:https://whatlang.org/

1.1K 119
95 clean-text

🧹 用于文本清洗的Python包

1.0K 83
96 contextualized-topic-models

一个用于运行上下文主题建模的Python包。CTMs将上下文嵌入(如BERT)与主题模型相结合,以获得连贯的主题。发表于EACL和ACL 2021(Bianchi等人)。

1.3K 155
97 Keras-TextClassification

基于Keras的工具包,用于中文文本分类、多标签分类和句子相似度,支持多种模型(FastText、TextCNN、RCNN、BERT等)。

1.8K 397
98 CLUECorpus2020

大规模中文预训练语料库100G

1.0K 83
99 lingua-go

Go语言最准确的自然语言检测库,适用于短文本和混合语言文本

1.4K 81
100 DeepMoji

用于分析情感、情绪、讽刺等的最先进的深度学习模型。

1.6K 307