#4 · 主分类: AI音乐生成
riffusion-hobby
Stable Diffusion 实时音乐生成
项目最后更新:07/22/24
GitHub Stars
3.9K
Forks数量
477
贡献者数量
6
许可证
MIT
收录理由
Riffusion 的独特之处在于它把音乐当成图像来处理。它并不直接对音频建模,而是在声谱图帧上运行稳定扩散,再把生成好的帧转回声音,这种思路在实时音乐生成里相当少见。这个仓库把扩散流程、声谱图与音频的相互转换、命令行工具以及一个轻量的 Flask 推理服务都收在同一个代码库里,想弄懂基于文本条件的音频合成是怎么工作的,从这里起步很合适。它还提供了提示插值功能,能在“教堂钟声”和“爵士钢琴”这类描述之间平滑过渡,是展示如何随时间引导扩散过程的好例子。需要留意的是,这个项目已经不再积极维护,而且实时生成对显卡要求不低,你可能得自己改代码、升级 diffusers 版本。对探索生成式音频的爱好者和研究者而言,它依然是一份有用且具有历史意义的参考资料。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。