#61 · 主分类: 自然语言处理与文本处理

texthero

machine-learning nlp nlp-pipeline text-clustering text-mining text-preprocessing text-representation text-visualization texthero word-embeddings

从零到英雄的文本预处理、表示和可视化。

项目最后更新:08/29/23

GitHub Stars

2.9K

Forks数量

236

贡献者数量

21

许可证

MIT

收录理由

Texthero 是一个以 Pandas 为基础的文本处理工具包,面向那些需要频繁处理原始文本、却不想从零搭建预处理流程的开发者。它将 Gensim、NLTK、spaCy 和 scikit-learn 统一封装在同一套接口后面,常见的清洗步骤,比如去除数字、括号、变音符号、标点和停用词,或者生成 TF-IDF 与自定义词向量,都可以通过几行链式调用完成;紧接着做聚类也只需再多一步。内置的可视化功能,比如把 PCA 降维后的向量按聚类或主题着色绘制成散点图,能帮你直观把握语料的结构,而不是只盯着数值。它面向熟悉 Pandas、但未必了解语言学的程序员,上手难度被控制得很低。需要注意的是,这个项目目前处于 beta 阶段,且近期没有更新,因此更适合做探索性分析和学习,而不太适合直接用于生产环境。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目