#128 · 主分类: 语音合成与识别

StreamSpeech

all-in-one asr audio-processing machine-translation non-autoregressive seamless simultaneous-translation speech speech-enhancement speech-processing speech-recognition speech-synthesis speech-to-text speech-translation streaming-audio text-to-audio text-to-speech translation tts voice

StreamSpeech是一个“一体化”无缝模型,用于离线同步语音识别、语音翻译和语音合成。

项目最后更新:06/29/25

GitHub Stars

1.3K

Forks数量

105

贡献者数量

2

许可证

MIT

收录理由

StreamSpeech 用一个统一的模型把离线与流式语音识别、语音到文本翻译、语音到语音翻译以及语音合成都串了起来,省去了拼接多套独立工具的麻烦。在同声传译过程中,它能把刚刚生成的识别文本和译文实时抛出来,做现场字幕或草稿字幕都很顺手,不必等整段语音播完。项目在 Hugging Face 上放了法语、西班牙语和德语到英语的预训练权重,仓库里还带着 ACL 2024 论文的代码、训练配方和对比工具。想快速验证实时口译效果的人,可以先玩网页演示或本地图形界面,再决定要不要把这套模型接进自己的系统。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目