#39 · 主分类: 推理与本地部署

vllm-omni

audio-generation diffusion image-generation inference model-serving multimodal pytorch transformer video-generation world-model

用于全模态模型高效推理的框架

项目最后更新:08/29/26

GitHub Stars

6.5K

Forks数量

1.6K

贡献者数量

361

许可证

Apache-2.0

收录理由

纯文本推理服务面对同时产出语音、图像、视频、音频乃至机器人动作序列的模型时往往力不从心。vLLM-Omni 将 vLLM 引擎的能力扩展到了这类全模态模型上,通过分阶段流水线执行与资源解耦分配,妥善处理了扩散变换器等非自回归架构及异构输出的场景,在输出类型多变时依然能维持较高吞吐。团队若在服务 Qwen3-Omni、各类 TTS 系统或图像视频扩散生成模型,可直接借助其 OpenAI 兼容接口获得流式与并行执行能力,作为现成的部署层相当顺手。项目随上游 vLLM 偶数次小版本定期发布稳定版,升级节奏清晰可预期,不必担心追踪一个不断移动的目标。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目