#177 · 主分类: 深度学习框架

ESFT

专家专用微调

项目最后更新:05/22/25

GitHub Stars

746

Forks数量

267

贡献者数量

3

许可证

MIT

收录理由

对混合专家(MoE)模型做全量微调时,大部分专家在特定任务上其实处于闲置状态,计算和存储都被浪费了。ESFT 的思路是先根据你的评估数据给每个专家打分,只保留与任务相关的专家参与训练,再生成一份稀疏适配器配置,这样实际更新的参数只占很小一部分。仓库里提供了完整的训练代码、专家打分脚本、配置生成脚本以及评估工具,你可以直接在自己的 MoE 模型和数据集上跑通整个流程,而不只是看论文里的描述。这是一个与 EMNLP 论文配套的研究型代码库,使用前需要自己调整脚本和配置,不像成熟的库那样开箱即用。如果你正在微调稀疏 MoE 模型,希望在不牺牲任务效果的前提下降低显存和存储开销,这份实现很值得参考。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目