#127 · 主分类: AI对话与Chatbot

quillman

ai language-model python serverless speech-recognition speech-to-text

语音聊天应用

项目最后更新:05/28/26

GitHub Stars

1.2K

Forks数量

159

贡献者数量

14

许可证

MIT

收录理由

QuiLLMan 提供的是一套完整的语音聊天应用,而非仅仅封装模型,这让它成为构建对话式语音界面时很有参考价值的起点。后端运行 Kyutai Lab 的 Moshi 语音到语音模型,配合 Mimi 流式编码器,借助双向 WebSocket 流和 Opus 音频压缩,网络往返延迟被压得很低,回复节奏能接近真人对话,而不是传统语音助手那种先停顿再应答的生硬感。代码结构清晰:React 前端通过 FastAPI 提供服务,独立的 Moshi WebSocket 推理模块负责模型加载与流式状态管理,两者都以 serverless Modal 应用部署,空闲时可缩容到零。开发者或小团队可以直接拿它作为低延迟语音机器人的脚手架,研究后端如何管理流式音频状态,或者先跑起开发服务器测试 WebSocket 管线再动手改造。需要注意的是,这个项目更偏演示和实验场,而非开箱即用的成品,想用于生产还得自己在此基础上继续开发。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目