#74 · 主分类: AI工具目录与精选清单

Awesome-LLM-Strawberry

chain-of-thought coding llm mathematics mcts openai-o1 reinforcement-learning strawberry

一个收集LLM论文、博客和项目的合集,重点关注OpenAI o1 🍓及推理技术。

项目最后更新:12/17/25

GitHub Stars

6.9K

Forks数量

368

贡献者数量

28

许可证

Apache-2.0

收录理由

OpenAI o1 这类推理模型的资料散落在官方文档、实验室博客和论文里,想系统跟上并不容易。这个仓库把一手来源收拢到了一处:OpenAI 自己的文档与公告、DeepSeek 和 Google DeepMind 等实验室的解读,以及关于思维链、强化学习和推理时扩展的关键论文。开源部分尤其实用,指向了可以实际查看或运行的模型与训练代码,从 Qwen 的 QwQ 到 DeepSeek R1,再到 OpenRLHF 这样的 RLHF 框架。它更像一份阅读清单和研究地图,而不是可直接部署的工具,并且会随着领域进展持续更新。想理解或复现 o1 式训练的团队,从这里入手能省下不少摸索时间。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目