#67 · 主分类: 基础模型

InternLM-XComposer

chatgpt foundation gpt gpt-4 instruction-tuning language-model large-language-model large-vision-language-model llm mllm multi-modality multimodal supervised-finetuning vision-language-model vision-transformer visual-language-learning

InternLM-XComposer2.5-OmniLive:面向长期流式视频和音频交互的综合多模态系统

项目最后更新:05/26/25

GitHub Stars

2.9K

Forks数量

175

贡献者数量

17

许可证

Apache-2.0

收录理由

InternLM-XComposer 为想直接使用视觉语言模型、又不想从零搭建的团队提供了一个扎实的起点。7B 权重能处理 24K 到 96K 的长上下文交错图文输入,支持超高分辨率图像和细粒度视频的理解,也能进行多轮、多图对话;仓库里除了预训练权重,还附带微调代码与评估脚本。核心模型之外,几个配套项目同样值得关注:一个多模态奖励模型,一个面向长时间流式视频与音频交互的 OmniLive 系统,以及 ShareGPT4V、MMDU 等数据集。这样的组合,无论是做视觉问答、文档与网页理解,还是内容生成,都能作为改编的合适基础。把它当作开放的基础模型加训练配方来用,而不是开箱即用的成品。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目