#129 · 主分类: 语音合成与识别
TangoFlux
[ICLR 2026] TangoFlux:基于流匹配的超快速且忠实的文本到音频生成
项目最后更新:01/28/26
GitHub Stars
882
Forks数量
80
贡献者数量
11
许可证
Other
收录理由
TangoFlux 能把一段文字描述变成最长 30 秒、44.1kHz 的音频,靠着 flow matching 的 transformer 架构,只要少数几次采样就能出结果,比早期基于扩散的文本转音频模型快不少。这种速度很适合拿来快速生成配音占位、游戏和视频里的音效素材,或者任何需要按需渲染音频的流程。仓库里不光有训练好的权重,还提供了完整的训练代码、偏好优化阶段,以及配套的 CRPO 数据集和生成脚本,团队想自己调数据或者整个流程从头复现都能做到,而不是只能加载现成的模型。不过动手之前得留意一点:这个项目只供研究使用,用的是 Stability AI 的社区许可,产品上线前最好先确认授权范围是否合适。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。