#12 · 主分类: 自然语言处理与文本处理
trafilatura
Python 和命令行工具,用于抓取网页文本和元数据:爬取、抓取、提取,输出为 CSV、JSON、HTML、MD、TXT、XML。
项目最后更新:08/28/26
GitHub Stars
6.7K
Forks数量
425
贡献者数量
72
许可证
Apache-2.0
收录理由
把抓下来的网页直接喂给语言模型或搜索引擎,几乎每个人都会撞上同一个麻烦:页面里真正有用的部分常常被导航菜单、弹窗提示和页脚链接淹没。Trafilatura 就是用来对付这种噪音的,它能把正文、元数据和评论单独挑出来,整理成干净的纯文本、Markdown、JSON 或 XML-TEI 格式,而且既可以用 Python 库调用,也可以当命令行工具使。做训练语料、搭 RAG 流程,或者跑新闻聚合的团队,通常会让它先把原始 HTML 规整成可靠的文字,再交给下游处理。如果你经常需要批量抓取页面并去掉杂质,这个工具能省下大量清理时间,每个项目都能少花好几个钟头在清洗上。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。