#66 · 主分类: 自然语言处理与文本处理

HarvestText

dependency-parser gitee harvesttext keyword-extraction named-entity-recognition new-word-discovery nlp pyhanlp sentiment-analysis text-cleaning text-segmentation text-summarization unsupervised

文本挖掘和预处理工具(文本清洗、新词发现、情感分析、实体识别链接、关键词抽取、知识抽取、句法分析等),无监督或弱监督方法

项目最后更新:05/13/24

GitHub Stars

2.6K

Forks数量

340

贡献者数量

5

许可证

MIT

收录理由

HarvestText 是一套面向中文文本的挖掘与预处理工具,核心思路围绕无监督和弱监督方法展开,因此即便没有大规模标注数据,也能产出可用的分析结果。它覆盖了日常预处理中的琐碎环节:清理杂乱网页文本、在保留省略号与引号等特殊标点的情况下切分句子、发现传统分词器容易漏掉的新词。在实体处理上更为突出,能把别名、缩写关联到标准名称,甚至能从大量语料中自动找出候选别名。内置的财经、饮食、法律、IT 等领域词典,省去了不少前期准备功夫。项目文档用《三国演义》社交网络分析、中超球迷评论情感分析、近代史资料的关系抽取来演示用法,让人直观感受到它的典型场景:在对杂乱中文文本做较重建模之前,先进行探索性分析和预处理。对于处理小说、社交媒体帖子或专业中文文献的团队来说,低监督需求是一个很实际的优势。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目