#36 · 主分类: 基础模型

Qwen3-Omni

Qwen3-omni 是阿里云 Qwen 团队开发的原生端到端全模态大语言模型,能够理解文本、音频、图像和视频,并实时生成语音。

项目最后更新:04/23/26

GitHub Stars

4.0K

Forks数量

291

贡献者数量

1

许可证

Apache-2.0

收录理由

市面上大多数开源模型往往把语音、视觉和语言能力拆成独立的模块,需要开发者自行拼接,既费时又容易引入延迟。Qwen3-Omni 则不同,它是阿里云 Qwen 团队推出的端到端全模态模型,输入文本、音频、图片和视频,就能实时生成自然语音回复,很适合语音助手、实时听写应答这类对延迟敏感的场景,省去了多模型串联的麻烦。仓库里提供了 Hugging Face 和 ModelScope 上的模型权重、推理代码、Cookbooks 教程,还有在线演示,你可以先在网页上交互体验一下,再决定是否集成。对于想要快速获得一个能同时处理语音和视觉交互的可用基线、又不想自己组装多个单一功能模型的团队来说,这是一个很实际的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目