#66 · 主分类: 自然语言处理与文本处理
HarvestText
文本挖掘和预处理工具(文本清洗、新词发现、情感分析、实体识别链接、关键词抽取、知识抽取、句法分析等),无监督或弱监督方法
项目最后更新:05/13/24
GitHub Stars
2.6K
Forks数量
340
贡献者数量
5
许可证
MIT
收录理由
HarvestText 是一套面向中文文本的挖掘与预处理工具,核心思路围绕无监督和弱监督方法展开,因此即便没有大规模标注数据,也能产出可用的分析结果。它覆盖了日常预处理中的琐碎环节:清理杂乱网页文本、在保留省略号与引号等特殊标点的情况下切分句子、发现传统分词器容易漏掉的新词。在实体处理上更为突出,能把别名、缩写关联到标准名称,甚至能从大量语料中自动找出候选别名。内置的财经、饮食、法律、IT 等领域词典,省去了不少前期准备功夫。项目文档用《三国演义》社交网络分析、中超球迷评论情感分析、近代史资料的关系抽取来演示用法,让人直观感受到它的典型场景:在对杂乱中文文本做较重建模之前,先进行探索性分析和预处理。对于处理小说、社交媒体帖子或专业中文文献的团队来说,低监督需求是一个很实际的优势。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。