#11 · 主分类: 数据标注与标签工具

AutoCrawler

bigdata chromedriver crawler customizable deep-learning google image-crawler multiprocess python selenium thread

Google、Naver 多进程图片爬虫(Selenium)

项目最后更新:08/29/26

GitHub Stars

1.7K

Forks数量

423

贡献者数量

14

许可证

Apache-2.0

收录理由

做视觉模型训练时,最繁琐的一步往往是把搜索结果一张张存下来。这个工具用 Selenium 驱动真实的 Chrome 浏览器,自动从 Google 和 Naver 抓取匹配图片,并通过多线程并行处理,让一长串关键词不会拖到天荒地老。它支持下载原图而非缩略图,也能按人脸模式搜索;爬取结束后还会检查各目录的文件数量,明显低于平均值的文件夹会被标出来,方便你在训练前发现某些类别数据不足。命令行里可以控制线程数、无头模式、代理列表以及每个网站的上限,遇到 Google 改版,只需修改 collect_links.py 这个脚本,不用改动整个项目。对于想批量收集参考图片、又希望流程可重复的开发者来说,这个工具相当实用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目