GitHub Stars
7.4K
Forks数量
563
贡献者数量
6
许可证
Apache-2.0
收录理由
LWM 是一个值得认真研究的代码库,尤其适合那些想突破长上下文处理极限的团队。它基于 7B 参数的多模态自回归架构,用大量长视频和书籍训练而成,能同时理解和生成文本、图像与视频,上下文窗口最高可达一百万 token,这一规模与长文档检索、长视频理解等任务的需求相当。仓库内容远超论文本身:训练栈围绕 RingAttention、掩码序列打包以及平衡语言与视觉目标的损失加权做了深度优化,既能直接用来训练自己的长序列模型,也能为多模态训练中如何控制内存和算力提供参考。作者还一并发布了纯文本和对话版本,想快速用于长文档问答或长视频对话场景的话,可以直接下载现成检查点,不必从头训练。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。