#114 · 主分类: 语音合成与识别

BS-RoFormer

artificial-intelligence attention-mechanisms deep-learning music-source-separation transformers

实现 Band Split Roformer,字节跳动 AI 实验室的 SOTA 注意力网络,用于音乐源分离。

项目最后更新:06/14/26

GitHub Stars

919

Forks数量

45

贡献者数量

4

许可证

MIT

收录理由

做音乐人声分离,过去要么从零训练一个沉重的分离模型,要么将就使用效果平平的通用方案;BS-RoFormer给出了另一条路,更直接。它是对字节跳动提出的频带分割Transformer的PyTorch实现,在频率和时间两个维度上采用轴向注意力,并用旋转位置编码取代了学习得到的绝对位置——论文认为这一改动显著提升了输出质量。仓库同时支持立体声训练,一次推理就能产出多个音轨,社区成员也已开源了训练好的权重和针对人声的训练代码,包括一个Mel-Band RoFormer变体。也就是说,你不必重头训练所有组件,就能从论文出发跑到真正的推理环节。这套模型还被用在过实际的混音作品里,比如一首凯蒂·佩里的重混。如果你打算做音轨分离或重混工具,想找一个在真实场景中留下过足迹、而非只在榜单上亮眼的模型,这里是个很实在的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目