#87 · 主分类: 自然语言处理与文本处理
textacy
NLP,spaCy前后
项目最后更新:09/22/23
GitHub Stars
2.2K
Forks数量
247
贡献者数量
35
许可证
Other
收录理由
textacy 构建在 spaCy 之上,专门处理 spaCy 本身不负责的那些环节。在解析之前,它提供了清洗和规范化原始文本的工具;在解析之后,你可以直接提取 n-gram、实体、缩写、关键词以及主谓宾三元组,无需自己编写抽取代码。此外,它还涵盖了分词与向量化辅助功能、主题建模、字符串相似度比较,以及可读性统计(如 Flesch-Kincaid 年级水平和类符形符比)。对于数据科学家和 NLP 工程师来说,无论是编写分析脚本还是搭建研究原型,只要让 spaCy 负责解析、textacy 处理其余部分,这个库都是相当可靠的选择。它内置的多个数据集(包括国会演讲、历史文献和 Reddit 评论)也让你能快速试验想法,省去自己寻找语料的麻烦。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。