自然语言处理与文本处理

用于语言检测、文本分类、分词、文本规范化等核心自然语言处理任务的库和工具。

共 124 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 101–120 项,共 124 个

排名 项目 Stars Forks
101 jiant

jiant 是一个自然语言处理工具包

1.7K 296
102 BERT-NER-Pytorch

使用BERT(Softmax、CRF、Span)的中文命名实体识别(NER)

2.2K 433
103 nlg-eval

用于自然语言生成的各种无监督自动评估指标的评估代码。

1.4K 226
104 insuranceqa-corpus-zh

:helicopter: 保险行业语料库,聊天机器人

1.1K 340
105 konlpy

用于韩语自然语言处理的Python包。

1.5K 325
106 Familia

工业主题建模工具包

2.6K 583
107 named_entity_recognition

中文命名实体识别(包括多种模型:HMM,CRF,BiLSTM,BiLSTM+CRF的具体实现)

2.3K 527
108 magnitude

快速高效的通用的向量嵌入工具包。

1.7K 122
109 NeuroNER

基于神经网络的命名实体识别,易于使用且效果领先。

1.7K 472
110 eda_nlp

NLP数据增强,发表于EMNLP 2019

1.7K 312
111 bi-att-flow

双向注意力流(BiDAF)网络是一个多阶段分层过程,以不同粒度级别表示上下文,并使用双向注意力流机制实现查询感知的上下文表示,而无需早期摘要。

1.5K 667
112 NCRFpp

NCRF++,一个神经序列标注工具包。易于用于任何序列标注任务(如NER、POS、分词)。它包含字符LSTM/CNN、词LSTM/CNN和softmax/CRF组件。

1.9K 436
113 sentiment

基于AFINN的Node.js情感分析。

2.7K 310
114 TextInfoExp

自然语言处理实验(sougou数据集),TF-IDF,文本分类、聚类、词向量、情感识别、关系抽取等

1.7K 753
115 datumbox-framework

Datumbox是一个用Java编写的开源机器学习框架,允许快速开发机器学习和统计应用程序。

1.1K 279
116 textrank

TextRank 的 Python 3 实现。

1.3K 246
117 xmnlp

xmnlp:提供中文分词, 词性标注, 命名体识别,情感分析,文本纠错,文本转拼音,文本摘要,偏旁部首,句子表征及文本相似度计算等功能

1.3K 184
118 THUOCL

THUOCL(清华大学开放中文词库)

1.1K 213
119 BertSum

论文《Fine-tune BERT for Extractive Summarization》的代码

1.5K 410
120 nlp_xiaojiang

自然语言处理(NLP),小姜机器人(闲聊检索式聊天机器人),BERT句向量-相似度(句子相似度),XLNET句向量-相似度(文本xlnet嵌入),文本分类,实体提取(NER,BERT+BiLSTM+CRF),数据增强(文本增强,数据增强),同义句同义词生成,句子主干提取(mainpart),中文汉语短文本相似度,文本特征工程,keras-http-service调用

1.5K 390