#12 · 主分类: 自然语言处理与文本处理

trafilatura

article-extractor corpus-builder corpus-tools crawler html-to-markdown html2text llm news-aggregator news-crawler nlp rag readability rss-feed scraping tei text-cleaning text-extraction text-mining text-preprocessing web-scraping

Python 和命令行工具,用于抓取网页文本和元数据:爬取、抓取、提取,输出为 CSV、JSON、HTML、MD、TXT、XML。

项目最后更新:08/28/26

GitHub Stars

6.7K

Forks数量

425

贡献者数量

72

许可证

Apache-2.0

收录理由

把抓下来的网页直接喂给语言模型或搜索引擎,几乎每个人都会撞上同一个麻烦:页面里真正有用的部分常常被导航菜单、弹窗提示和页脚链接淹没。Trafilatura 就是用来对付这种噪音的,它能把正文、元数据和评论单独挑出来,整理成干净的纯文本、Markdown、JSON 或 XML-TEI 格式,而且既可以用 Python 库调用,也可以当命令行工具使。做训练语料、搭 RAG 流程,或者跑新闻聚合的团队,通常会让它先把原始 HTML 规整成可靠的文字,再交给下游处理。如果你经常需要批量抓取页面并去掉杂质,这个工具能省下大量清理时间,每个项目都能少花好几个钟头在清洗上。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目