#60 · 主分类: 基础模型
Qwen2.5-Omni
Qwen2.5-Omni 是阿里云 Qwen 团队推出的端到端多模态模型,能够理解文本、音频、视觉、视频,并支持实时语音生成。
项目最后更新:06/12/25
GitHub Stars
4.1K
Forks数量
327
贡献者数量
12
许可证
Apache-2.0
收录理由
Qwen2.5-Omni 把 Thinker-Talker 架构用在了端到端多模态模型上,生成语音时会直接结合当前看到的画面和听到的声音,所以实时对话显得自然流畅,不会像传统方案那样生硬。它能同时接收文本、图像、音频和视频,并流式返回文字回答与合成语音,想做语音助手的话,不用再东拼西凑地接语音转文字、视觉识别和 TTS 三个独立服务。仓库里提供了 transformers 和 vLLM 的用法示例,还有 4-bit 量化版本以及通过 MNN 部署到边缘设备的说明,从本地原型到生产环境的路子都比较清晰。对需要同时处理多种模态的助手类项目来说,与其手动串联多个单用途模型,不如先拿它来做评估和验证。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。