#64 · 主分类: 基础模型

LWM

大型世界模型——以百万上下文建模文本和视频

项目最后更新:10/19/24

GitHub Stars

7.4K

Forks数量

563

贡献者数量

6

许可证

Apache-2.0

收录理由

LWM 是一个值得认真研究的代码库,尤其适合那些想突破长上下文处理极限的团队。它基于 7B 参数的多模态自回归架构,用大量长视频和书籍训练而成,能同时理解和生成文本、图像与视频,上下文窗口最高可达一百万 token,这一规模与长文档检索、长视频理解等任务的需求相当。仓库内容远超论文本身:训练栈围绕 RingAttention、掩码序列打包以及平衡语言与视觉目标的损失加权做了深度优化,既能直接用来训练自己的长序列模型,也能为多模态训练中如何控制内存和算力提供参考。作者还一并发布了纯文本和对话版本,想快速用于长文档问答或长视频对话场景的话,可以直接下载现成检查点,不必从头训练。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目