#80 · 主分类: 语音合成与识别
sglang-omni
SGLang-Omni 是一个用于音频模型(TTS、ASR)和统一多模态模型的高性能服务框架。
项目最后更新:08/30/26
GitHub Stars
977
Forks数量
400
贡献者数量
96
许可证
Apache-2.0
收录理由
语音合成与识别模型的API服务与聊天模型托管是两套不同的课题,这个框架正好抓住了差异。它把生成过程拆成协作的多个阶段,每一阶段有自己的调度器,张量数据通过共享内存和集群传输在worker之间移动,负载上升时流式语音依然能保持低延迟响应。接口兼容OpenAI,包括聊天、/v1/audio/speech、批量和流式生成、上传音色,以及/v1/audio/transcriptions,Qwen3-TTS、Qwen3-ASR、Higgs Audio、Fish Speech和带说话人分离的转写功能都开箱即用。如果运营语音产品、语音助手或多模态服务,与其把多个引擎拼凑起来,不如统一在这一层,是个实际的选项。想自己搭建语音serving栈的开发者,也能从它的多阶段设计中看到调度和传输的具体取舍例子。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。