#85 · 主分类: 计算机视觉

nsfw_data_scraper

content-moderation deep-learning machine-learning nsfw nsfw-classifier pornography

用于聚合图像数据以训练NSFW图像分类器的脚本集合

项目最后更新:01/21/24

GitHub Stars

12.6K

Forks数量

2.8K

贡献者数量

7

许可证

MIT

收录理由

训练内容审核模型的人很快就会发现,真正的瓶颈往往不在模型结构,而在数据本身。这个项目用一组打包在Docker里的Shell脚本,自动从Reddit等Ripme支持的站点抓取数万张图片,粗略分成五类:色情、成人动漫、性感但不露骨的内容,以及适合工作场合的照片和画作。仓库作者已经提前跑完了收集链接的步骤,所以下载好的URL列表直接随项目附带,后续脚本则负责把图片分到训练和测试文件夹,并顺手清掉损坏的文件。作者也坦承数据本身比较嘈杂,需要使用者自行清洗后才能用于训练——不过考虑到省去了最繁琐的抓取环节,这个代价也算合理。如果想把分类器从头跑到尾,仓库里还提供了一个fastai笔记本作为参考。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目