GitHub Stars
4.6K
Forks数量
387
贡献者数量
16
许可证
MIT
收录理由
Ultravox 绕开了常见的语音转文字环节:它不先把语音转成文本再交给大模型,而是直接把音频映射进模型自身的表征空间。这条直达路径让延迟低到足以支撑真正的实时对话,对语音助手、电话机器人这类交互场景很关键。仓库里提供了基于 Llama 的模型权重和 8B 变体,还有训练代码,既能直接跑现成模型,也可以换一个开源基座模型重新训练投影层。如果你不想租用别人的语音服务,想自己部署,或者想搞明白一个能听会说的 LLM 究竟是怎么造出来的,这里是个很好的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。