#47 · 主分类: 基础模型

ultravox

ai llm slm speech

用于实时语音的快速多模态LLM

项目最后更新:12/12/25

GitHub Stars

4.6K

Forks数量

387

贡献者数量

16

许可证

MIT

收录理由

Ultravox 绕开了常见的语音转文字环节:它不先把语音转成文本再交给大模型,而是直接把音频映射进模型自身的表征空间。这条直达路径让延迟低到足以支撑真正的实时对话,对语音助手、电话机器人这类交互场景很关键。仓库里提供了基于 Llama 的模型权重和 8B 变体,还有训练代码,既能直接跑现成模型,也可以换一个开源基座模型重新训练投影层。如果你不想租用别人的语音服务,想自己部署,或者想搞明白一个能听会说的 LLM 究竟是怎么造出来的,这里是个很好的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目