#104 · 主分类: AI对话与Chatbot

parlor

apple-silicon gemma kokoro litert-lm local-llm mlx multimodal on-device-ai python real-time speech-recognition text-to-speech voice-assistant

设备端、实时多模态AI,具有类似GPT-Live的功能

项目最后更新:08/03/26

GitHub Stars

2.0K

Forks数量

263

贡献者数量

7

许可证

Apache-2.0

收录理由

Parlor 是一个早期研究预览项目,展示了完全本地化的语音助手能做到什么程度:它能进行实时的口语对话,同时具备视觉感知和流式语音输出,全程不把音频发送到任何云端服务。整个技术栈整合了语音识别、本地运行的大模型来生成回复,以及逐句合成的文本转语音,还带有一个快速的轮流发言判断机制,用来识别你什么时候说完了话。作者是在自己搭建免费英语陪练服务的过程中写下这个项目的,也坦白承认它还很粗糙,边界情况不少。对于想了解如何把 WebSocket 音频流、模型推理和低延迟的说话人切换检测串联起来的开发者来说,这里的架构写得足够清楚,可以直接照着抄。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目