#80 · 主分类: 语音合成与识别

sglang-omni

asr audio-generation cuda distributed-inference inference model-serving multimodal music-generation openai-api pytorch sglang speech-recognition streaming text-to-speech tts

SGLang-Omni 是一个用于音频模型(TTS、ASR)和统一多模态模型的高性能服务框架。

项目最后更新:08/30/26

GitHub Stars

977

Forks数量

400

贡献者数量

96

许可证

Apache-2.0

收录理由

语音合成与识别模型的API服务与聊天模型托管是两套不同的课题,这个框架正好抓住了差异。它把生成过程拆成协作的多个阶段,每一阶段有自己的调度器,张量数据通过共享内存和集群传输在worker之间移动,负载上升时流式语音依然能保持低延迟响应。接口兼容OpenAI,包括聊天、/v1/audio/speech、批量和流式生成、上传音色,以及/v1/audio/transcriptions,Qwen3-TTS、Qwen3-ASR、Higgs Audio、Fish Speech和带说话人分离的转写功能都开箱即用。如果运营语音产品、语音助手或多模态服务,与其把多个引擎拼凑起来,不如统一在这一层,是个实际的选项。想自己搭建语音serving栈的开发者,也能从它的多阶段设计中看到调度和传输的具体取舍例子。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目