#67 · 主分类: 基础模型
InternLM-XComposer
InternLM-XComposer2.5-OmniLive:面向长期流式视频和音频交互的综合多模态系统
项目最后更新:05/26/25
GitHub Stars
2.9K
Forks数量
175
贡献者数量
17
许可证
Apache-2.0
收录理由
InternLM-XComposer 为想直接使用视觉语言模型、又不想从零搭建的团队提供了一个扎实的起点。7B 权重能处理 24K 到 96K 的长上下文交错图文输入,支持超高分辨率图像和细粒度视频的理解,也能进行多轮、多图对话;仓库里除了预训练权重,还附带微调代码与评估脚本。核心模型之外,几个配套项目同样值得关注:一个多模态奖励模型,一个面向长时间流式视频与音频交互的 OmniLive 系统,以及 ShareGPT4V、MMDU 等数据集。这样的组合,无论是做视觉问答、文档与网页理解,还是内容生成,都能作为改编的合适基础。把它当作开放的基础模型加训练配方来用,而不是开箱即用的成品。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。