#132 · 主分类: 教育与研究

TinyZero

DeepSeek R1-Zero 的最小复现

项目最后更新:02/27/26

GitHub Stars

13.2K

Forks数量

1.6K

贡献者数量

15

许可证

Apache-2.0

收录理由

TinyZero把一次推理模型训练压缩到最精简的形态,在倒计时和乘法任务上复现了DeepSeek R1-Zero的做法,底层基于veRL。它最核心的发现是:一个3B的基础模型,仅靠强化学习,不经过任何监督微调,就能自己长出自我验证和搜索的行为。训练脚本和数据预处理步骤都短到可以一步步手跟,适合在扩大规模之前,先直观感受强化学习如何激发出推理能力。作者表示,在不算太高的硬件条件下,花不到30美元就能亲历那个“顿悟时刻”。需要提醒的是,这个仓库已经停止维护,作者建议直接使用上游的veRL库,所以更适合当作学习材料和参考配方,而不是一个可以继续在其上开发的工具。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目