#155 · 主分类: 深度学习框架
MoBA
MoBA:用于长上下文大语言模型的块注意力混合
项目最后更新:04/03/25
GitHub Stars
2.2K
Forks数量
159
贡献者数量
3
许可证
MIT
收录理由
传统注意力的计算量随序列长度呈二次方增长,训练超长上下文因此非常烧钱。MoBA 把混合专家(MoE)里的门控机制借用到注意力上,让每个查询 token 自己学习该关注哪些键值缓存块,而不是被预设的窗口或 sink 结构锁死。对研究长上下文模型的团队和训练工程师来说,这个项目有实际参考价值:仓库提供两个后端,naive 版用于可视化块选择过程,优化版报告了 40 倍加速;附带单元测试和一个 Llama 示例脚本。作者也坦诚地指出了限制——MoBA 不是开箱即用的稀疏注意力补丁,想获得加速收益必须对模型做继续训练,预训练好的权重不能直接替换。MoBA 已在 Kimi 的长上下文请求中上线,说明这套思路经得起真实业务场景的检验。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。