#60 · 主分类: 基础模型

Qwen2.5-Omni

Qwen2.5-Omni 是阿里云 Qwen 团队推出的端到端多模态模型,能够理解文本、音频、视觉、视频,并支持实时语音生成。

项目最后更新:06/12/25

GitHub Stars

4.1K

Forks数量

327

贡献者数量

12

许可证

Apache-2.0

收录理由

Qwen2.5-Omni 把 Thinker-Talker 架构用在了端到端多模态模型上,生成语音时会直接结合当前看到的画面和听到的声音,所以实时对话显得自然流畅,不会像传统方案那样生硬。它能同时接收文本、图像、音频和视频,并流式返回文字回答与合成语音,想做语音助手的话,不用再东拼西凑地接语音转文字、视觉识别和 TTS 三个独立服务。仓库里提供了 transformers 和 vLLM 的用法示例,还有 4-bit 量化版本以及通过 MNN 部署到边缘设备的说明,从本地原型到生产环境的路子都比较清晰。对需要同时处理多种模态的助手类项目来说,与其手动串联多个单用途模型,不如先拿它来做评估和验证。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目