#37 · 主分类: 自然语言处理与文本处理

sumy

html-extraction html-extractor html-page lsa nlp pagerank-algorithm python reduction summarization summarizer summary sumy text-extraction textteaser

用于文本文件和HTML页面自动摘要的模块。

项目最后更新:08/14/26

GitHub Stars

3.7K

Forks数量

539

贡献者数量

34

许可证

Apache-2.0

收录理由

Sumy 是一个用 Python 编写的库,同时提供命令行工具,能从长文档中挑出最关键的句子来生成抽取式摘要。如果你需要在管道处理之前先压缩一下文本,它是个很轻的选择。它实现了 LSA、LexRank、Luhn、Edmundson 和 TextRank 等几种经典算法,你可以挨个试,找到最贴合自己文档风格的那一种,不必死守单一方法。它既能处理纯文本,也能直接读取 HTML 页面,想浓缩网页文章或订阅源时很方便。分词器、词干提取器和解析器都可以替换,想支持另一种语言或者调整文档读取方式,只需继承改写,不用大动干戈。这种模块化设计,加上简单的按句子数量指定长度的 API,让团队在不想引入大型模型的情况下,也能获得成熟且容易理解的摘要方案。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目