#172 · 主分类: 推理与本地部署

mixtral-offloading

colab-notebook deep-learning google-colab language-model llm mixture-of-experts offloading pytorch quantization

在Colab或消费级桌面上运行Mixtral-8x7B模型

项目最后更新:04/08/24

GitHub Stars

2.3K

Forks数量

225

贡献者数量

4

许可证

MIT

收录理由

Mixtral-8x7B 拥有 467 亿参数,远超多数家用电脑的内存容量。这个项目通过两种手段让模型变得可用:一是采用 HQQ 混合量化,对注意力层和专家层分别设置不同精度;二是实施按专家粒度的 MoE 卸载策略——每个专家只在处理当前 token 时才被调回 GPU,同时用 LRU 缓存保留最近使用过的专家,减少相邻 token 计算时的显存与内存交换。两者结合,使得模型能跑在单张消费级显卡或免费的 Colab 环境中。若你希望尝试开源的混合专家模型,又不想依赖多卡工作站,这个演示笔记本是很好的起点;不过目前还没有命令行工具,需要你参照笔记本自行修改。arXiv 上的技术报告给出了详细方法和实测结果,你可以对照自己的硬件权衡利弊,但要注意报告中的部分技术尚未在仓库中实现。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目