#165 · 主分类: 语音合成与识别

willow-inference-server

cuda deep-learning llama llm privacy speech-recognition speech-to-text text-to-speech vicuna webrtc whisper willow

开源、本地和自托管的高度优化的语言推理服务器,支持ASR/STT、TTS和LLM,通过WebRTC、REST和WS。

项目最后更新:02/12/26

GitHub Stars

512

Forks数量

60

贡献者数量

9

许可证

Apache-2.0

收录理由

这套推理服务器把语音识别与合成完全放在你自己的硬件上运行,音频数据不必为了调用云接口而离开本地网络。它以 Whisper 模型为核心,能做到接近实时的转写,同时内置文本转语音,适合搭建助手式的语音应答。性能调优上很下功夫,既能在 GTX 1060 这类入门级 CUDA 显卡上流畅跑,也能在 RTX 4090 上发挥全力。最出彩的是 WebRTC 通路:浏览器或客户端可以把音频流持续推送过来,连接挂上几天都不成问题,网络占用却很低,特别适合常开的家庭或办公室环境。你还能手动指定加载哪些 Whisper 模型、分配多少显存,意味着如果你手头已有合适的硬件,想要低延迟且完全私密的语音转写,这个项目相当值得一试。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目