GitHub Stars
2.4K
Forks数量
9
贡献者数量
3
许可证
MIT
收录理由
大多数文本生成视频的模型只能产出短短几秒的片段,而这个仓库所对应的研究项目把时长拉长到了一分钟左右,并且保持了画面的连贯性。它基于 CogVideoX 5B 扩散Transformer,融入了测试时训练层来处理整段视频中的长程依赖,同时保留原有注意力机制来精修每个三秒片段内的细节。仓库提供了从3秒到63秒的分阶段训练流程,还包含了运行所需的定制内核,方便研究者和工程师复现结果,或者在此基础上搭建自己的长视频实验。需要注意的是,训练过程依赖H100 GPU,所以它更适合拥有充足算力的团队作为研究参考,而不是直接放进生产环境。README写得相当详尽,训练和推理部分都有清晰的说明,对于想探索长视频生成的人来说,是一个很好的起点。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。