#89 · 主分类: 语音合成与识别
SALMONN
audio
audio-processing
audio-visual-understanding
bytedance
iclr2024
icml-2024
large-language-models
multi-modal
music
research
speech
speech-recognition
tsinghua-university
video
video-understanding
SALMONN系列:先进的多模态大语言模型套件
项目最后更新:08/24/26
GitHub Stars
1.5K
Forks数量
124
贡献者数量
7
许可证
Apache-2.0
收录理由
这是字节跳动与清华大学团队发布的多模态语言模型系列,相关成果发表在ICLR、ICML、ICASSP和ACL等学术会议上。模型不仅能处理文本,还接受音频、语音、音乐和视频输入,并针对感知内容回答自然语言问题。仓库提供了多个变体的预训练权重和推理代码,包括用于语音质量评估的版本,以及作者称为首个在流式全双工框架中统一视觉、语音、文本和动作的端到端模型ELLSA。对正在探索音频驱动对话系统的开发者来说,这是一份很有参考价值的实现:可以运行基准测试,了解多模态融合的具体做法,并在现有检查点上做微调。不过它更像研究原型,而不是开箱即用的成品服务,直接部署前需要自行评估和适配。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。