#37 · 主分类: 自然语言处理与文本处理
sumy
用于文本文件和HTML页面自动摘要的模块。
项目最后更新:08/14/26
GitHub Stars
3.7K
Forks数量
539
贡献者数量
34
许可证
Apache-2.0
收录理由
Sumy 是一个用 Python 编写的库,同时提供命令行工具,能从长文档中挑出最关键的句子来生成抽取式摘要。如果你需要在管道处理之前先压缩一下文本,它是个很轻的选择。它实现了 LSA、LexRank、Luhn、Edmundson 和 TextRank 等几种经典算法,你可以挨个试,找到最贴合自己文档风格的那一种,不必死守单一方法。它既能处理纯文本,也能直接读取 HTML 页面,想浓缩网页文章或订阅源时很方便。分词器、词干提取器和解析器都可以替换,想支持另一种语言或者调整文档读取方式,只需继承改写,不用大动干戈。这种模块化设计,加上简单的按句子数量指定长度的 API,让团队在不想引入大型模型的情况下,也能获得成熟且容易理解的摘要方案。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。