#134 · 主分类: 图像生成

ddpo-pytorch

用于微调扩散模型的DDPO,基于PyTorch实现并支持LoRA。

项目最后更新:03/22/24

GitHub Stars

776

Forks数量

72

贡献者数量

3

许可证

MIT

收录理由

微调扩散模型通常依赖成对的监督数据,但这个项目走的是另一条路:用去噪扩散策略优化(DDPO)把强化学习引入训练流程,让你能根据自己定义的评分目标来调整Stable Diffusion,比如压缩率或美学分数。开启LoRA后显存占用能控制在10GB以内,单张消费级显卡就能跑起来。代码把提示词和奖励函数设计成可插拔的模块,想换评分标准不用动训练主循环。需要提醒的是,这更像研究原型而非成熟库,默认配置只求快速跑通,实际效果得自己调大每轮样本数和梯度累积步数。对想尝试用强化学习做微调的开发者来说,这份实现值得参考。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目