#129 · 主分类: 语音合成与识别

TangoFlux

flow-matching generative-ai text-to-audio text-to-audio-ai tta

[ICLR 2026] TangoFlux:基于流匹配的超快速且忠实的文本到音频生成

项目最后更新:01/28/26

GitHub Stars

882

Forks数量

80

贡献者数量

11

许可证

Other

收录理由

TangoFlux 能把一段文字描述变成最长 30 秒、44.1kHz 的音频,靠着 flow matching 的 transformer 架构,只要少数几次采样就能出结果,比早期基于扩散的文本转音频模型快不少。这种速度很适合拿来快速生成配音占位、游戏和视频里的音效素材,或者任何需要按需渲染音频的流程。仓库里不光有训练好的权重,还提供了完整的训练代码、偏好优化阶段,以及配套的 CRPO 数据集和生成脚本,团队想自己调数据或者整个流程从头复现都能做到,而不是只能加载现成的模型。不过动手之前得留意一点:这个项目只供研究使用,用的是 Stability AI 的社区许可,产品上线前最好先确认授权范围是否合适。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目