#133 · 主分类: 自然语言处理与文本处理

ekphrasis

nlp nlp-library semeval spell-corrector spelling-correction text-processing text-segmentation tokenization tokenizer word-normalization word-segmentation

Ekphrasis 是一个用于社交网络文本的文本处理工具,提供分词、单词规范化、话题标签分割和拼写纠正,使用来自维基百科和 Twitter 语料库的词频统计。

项目最后更新:06/02/25

GitHub Stars

673

Forks数量

93

贡献者数量

5

许可证

MIT

收录理由

社交媒体上的文本往往很不规范,常规分词器面对拼写错误、粘连的标签、表情符号时常常力不从心。Ekphrasis 就是为这类输入而生的轻量工具,在把文本交给模型之前,它能先做一番整理。它能够识别复杂的表情符号、emoji、日期以及其他非结构化表达,适用于 Twitter 和 Facebook 内容;还能把标签拆分成组成它的单词,对非正式拼写做规范化,并纠正拼写错误的词。分词和拼写纠正依赖的是从英文维基百科和包含3.3亿条推文的语料中统计出的词频数据,如果你处理的是特定领域的数据,也可以用自己的语料生成统计信息。它更像一个专注的预处理工具,而不是完整的NLP框架,因此接入现有流程时几乎不需要额外配置。需要坦诚指出的是,这个项目已经不再积极维护,如果你依赖持续更新,需要权衡这一点,不过其核心功能目前依然稳定可用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目