#472 · 主分类: 教育与研究

RandOpt

black-box-optimization ensemble-learning large-language-models llm lora neuroevolution post-training reasoning transformers

官方代码库,对应论文“Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights”(ICML 2026 Spotlight)

项目最后更新:07/10/26

GitHub Stars

640

Forks数量

69

贡献者数量

4

许可证

Other

收录理由

RandOpt 是 Neural Thickets 论文的官方代码库,该论文提出了一种出奇简单的后训练思路:在预训练模型权重附近随机采样扰动,保留表现优异的那些,再将其集成为一个整体。作者证明,这种方法能与 PPO、GRPO 以及进化搜索等更成熟的方案一较高下。仓库提供了上手所需的一切:支持单机与多节点的 Slurm 脚本、本地运行模式、Docker 镜像、自定义数据集指南,以及将 top-K 集成模型蒸馏回单一模型的脚本。iterative-randopt 分支还能直接接入现有的 verl 或 Hugging Face TRL 流程。作为研究型项目,使用时需要根据自身环境做些调整,但对于任何对基于黑盒与集成的后训练方法感兴趣的人来说,这是一个很扎实的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目