#172 · 主分类: 推理与本地部署
mixtral-offloading
在Colab或消费级桌面上运行Mixtral-8x7B模型
项目最后更新:04/08/24
GitHub Stars
2.3K
Forks数量
225
贡献者数量
4
许可证
MIT
收录理由
Mixtral-8x7B 拥有 467 亿参数,远超多数家用电脑的内存容量。这个项目通过两种手段让模型变得可用:一是采用 HQQ 混合量化,对注意力层和专家层分别设置不同精度;二是实施按专家粒度的 MoE 卸载策略——每个专家只在处理当前 token 时才被调回 GPU,同时用 LRU 缓存保留最近使用过的专家,减少相邻 token 计算时的显存与内存交换。两者结合,使得模型能跑在单张消费级显卡或免费的 Colab 环境中。若你希望尝试开源的混合专家模型,又不想依赖多卡工作站,这个演示笔记本是很好的起点;不过目前还没有命令行工具,需要你参照笔记本自行修改。arXiv 上的技术报告给出了详细方法和实测结果,你可以对照自己的硬件权衡利弊,但要注意报告中的部分技术尚未在仓库中实现。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。