#89 · 主分类: 语音合成与识别

SALMONN

audio audio-processing audio-visual-understanding bytedance iclr2024 icml-2024 large-language-models multi-modal music research speech speech-recognition tsinghua-university video video-understanding

SALMONN系列:先进的多模态大语言模型套件

项目最后更新:08/24/26

GitHub Stars

1.5K

Forks数量

124

贡献者数量

7

许可证

Apache-2.0

收录理由

这是字节跳动与清华大学团队发布的多模态语言模型系列,相关成果发表在ICLR、ICML、ICASSP和ACL等学术会议上。模型不仅能处理文本,还接受音频、语音、音乐和视频输入,并针对感知内容回答自然语言问题。仓库提供了多个变体的预训练权重和推理代码,包括用于语音质量评估的版本,以及作者称为首个在流式全双工框架中统一视觉、语音、文本和动作的端到端模型ELLSA。对正在探索音频驱动对话系统的开发者来说,这是一份很有参考价值的实现:可以运行基准测试,了解多模态融合的具体做法,并在现有检查点上做微调。不过它更像研究原型,而不是开箱即用的成品服务,直接部署前需要自行评估和适配。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目