#85 · 主分类: 计算机视觉
nsfw_data_scraper
content-moderation
deep-learning
machine-learning
nsfw
nsfw-classifier
pornography
用于聚合图像数据以训练NSFW图像分类器的脚本集合
项目最后更新:01/21/24
GitHub Stars
12.6K
Forks数量
2.8K
贡献者数量
7
许可证
MIT
收录理由
训练内容审核模型的人很快就会发现,真正的瓶颈往往不在模型结构,而在数据本身。这个项目用一组打包在Docker里的Shell脚本,自动从Reddit等Ripme支持的站点抓取数万张图片,粗略分成五类:色情、成人动漫、性感但不露骨的内容,以及适合工作场合的照片和画作。仓库作者已经提前跑完了收集链接的步骤,所以下载好的URL列表直接随项目附带,后续脚本则负责把图片分到训练和测试文件夹,并顺手清掉损坏的文件。作者也坦承数据本身比较嘈杂,需要使用者自行清洗后才能用于训练——不过考虑到省去了最繁琐的抓取环节,这个代价也算合理。如果想把分类器从头跑到尾,仓库里还提供了一个fastai笔记本作为参考。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。