#11 · 主分类: 数据标注与标签工具
AutoCrawler
Google、Naver 多进程图片爬虫(Selenium)
项目最后更新:08/29/26
GitHub Stars
1.7K
Forks数量
423
贡献者数量
14
许可证
Apache-2.0
收录理由
做视觉模型训练时,最繁琐的一步往往是把搜索结果一张张存下来。这个工具用 Selenium 驱动真实的 Chrome 浏览器,自动从 Google 和 Naver 抓取匹配图片,并通过多线程并行处理,让一长串关键词不会拖到天荒地老。它支持下载原图而非缩略图,也能按人脸模式搜索;爬取结束后还会检查各目录的文件数量,明显低于平均值的文件夹会被标出来,方便你在训练前发现某些类别数据不足。命令行里可以控制线程数、无头模式、代理列表以及每个网站的上限,遇到 Google 改版,只需修改 collect_links.py 这个脚本,不用改动整个项目。对于想批量收集参考图片、又希望流程可重复的开发者来说,这个工具相当实用。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。