#128 · 主分类: 语音合成与识别
StreamSpeech
all-in-one
asr
audio-processing
machine-translation
non-autoregressive
seamless
simultaneous-translation
speech
speech-enhancement
speech-processing
speech-recognition
speech-synthesis
speech-to-text
speech-translation
streaming-audio
text-to-audio
text-to-speech
translation
tts
voice
StreamSpeech是一个“一体化”无缝模型,用于离线同步语音识别、语音翻译和语音合成。
项目最后更新:06/29/25
GitHub Stars
1.3K
Forks数量
105
贡献者数量
2
许可证
MIT
收录理由
StreamSpeech 用一个统一的模型把离线与流式语音识别、语音到文本翻译、语音到语音翻译以及语音合成都串了起来,省去了拼接多套独立工具的麻烦。在同声传译过程中,它能把刚刚生成的识别文本和译文实时抛出来,做现场字幕或草稿字幕都很顺手,不必等整段语音播完。项目在 Hugging Face 上放了法语、西班牙语和德语到英语的预训练权重,仓库里还带着 ACL 2024 论文的代码、训练配方和对比工具。想快速验证实时口译效果的人,可以先玩网页演示或本地图形界面,再决定要不要把这套模型接进自己的系统。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。