GitHub Stars
776
Forks数量
72
贡献者数量
3
许可证
MIT
收录理由
微调扩散模型通常依赖成对的监督数据,但这个项目走的是另一条路:用去噪扩散策略优化(DDPO)把强化学习引入训练流程,让你能根据自己定义的评分目标来调整Stable Diffusion,比如压缩率或美学分数。开启LoRA后显存占用能控制在10GB以内,单张消费级显卡就能跑起来。代码把提示词和奖励函数设计成可插拔的模块,想换评分标准不用动训练主循环。需要提醒的是,这更像研究原型而非成熟库,默认配置只求快速跑通,实际效果得自己调大每轮样本数和梯度累积步数。对想尝试用强化学习做微调的开发者来说,这份实现值得参考。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
stable-diffusion-webui
Stable Diffusion 网页界面
ComfyUI
最强大且模块化的扩散模型GUI、API和后端,具有图形/节点界面。
diffusers
🤗 Diffusers:PyTorch中最先进的扩散模型,用于图像、视频和音频生成。
upscayl
🆙 Upscayl - 适用于 Linux、MacOS 和 Windows 的 #1 免费开源 AI 图像放大工具。
InvokeAI
InvokeAI 是领先的开源创意引擎,专为 Stable Diffusion 设计,提供业界领先的 Web UI,用于生成和编辑视觉媒体。