#39 · 主分类: 推理与本地部署
vllm-omni
audio-generation
diffusion
image-generation
inference
model-serving
multimodal
pytorch
transformer
video-generation
world-model
用于全模态模型高效推理的框架
项目最后更新:08/29/26
GitHub Stars
6.5K
Forks数量
1.6K
贡献者数量
361
许可证
Apache-2.0
收录理由
纯文本推理服务面对同时产出语音、图像、视频、音频乃至机器人动作序列的模型时往往力不从心。vLLM-Omni 将 vLLM 引擎的能力扩展到了这类全模态模型上,通过分阶段流水线执行与资源解耦分配,妥善处理了扩散变换器等非自回归架构及异构输出的场景,在输出类型多变时依然能维持较高吞吐。团队若在服务 Qwen3-Omni、各类 TTS 系统或图像视频扩散生成模型,可直接借助其 OpenAI 兼容接口获得流式与并行执行能力,作为现成的部署层相当顺手。项目随上游 vLLM 偶数次小版本定期发布稳定版,升级节奏清晰可预期,不必担心追踪一个不断移动的目标。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。