#66 · 主分类: 基础模型
NExT-GPT
ICML 2024论文的代码和模型,NExT-GPT:Any-to-Any多模态大语言模型
项目最后更新:05/13/25
GitHub Stars
3.6K
Forks数量
360
贡献者数量
4
许可证
BSD-3-Clause
收录理由
NExT-GPT 是一个研究性质的多模态模型,它能接收文本、图像、视频和音频中的任意组合作为输入,也能以任意组合输出这些模态,例如用一段文字描述视频内容,或根据文本提示同时生成图像和声音片段。该仓库对应 ICML 2024 论文,提供了完整的模型权重、模态切换指令数据集以及详细的训练步骤说明,让研究者可以直接基于代码复现流程,而不必从论文中自行推导实现。其训练方法只调整少量参数,计算开销相对可控,便于深入分析。对于正在对比多模态理解与生成架构的研究人员和工程师来说,这是一个清晰可查的参考实现。需要注意的是,项目定位为研究发布,并非开箱即用的产品,部署与系统集成需要自己动手处理。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。