#146 · 主分类: 教育与研究

cleanrl

a2c actor-critic advantage-actor-critic ale atari deep-learning deep-reinforcement-learning gym machine-learning phasic-policy-gradient ppo proximal-policy-optimization python pytorch reinforcement-learning wandb

高质量的单文件深度强化学习算法实现,具有研究友好的特性(PPO, DQN, C51, DDPG, TD3, SAC, PPG)

项目最后更新:04/20/26

GitHub Stars

10.3K

Forks数量

1.2K

贡献者数量

45

许可证

Other

收录理由

CleanRL 是一套难得的深度强化学习代码库,它把可读性放在比抽象更重要的位置。PPO、DQN、SAC、TD3、C51、PPG 等算法的每个变体都封装在独立的 Python 单文件中,不需要在层层继承关系里翻找,就能完整追踪整个实现过程。对于正在学习深度强化学习的人,它是一份极佳的参考代码;对于想快速验证研究想法的人,它也是方便的实验起点。项目还提供了研究工作中常用的配套工具,比如随机种子设置保证实验可复现、TensorBoard 和 Weights & Biases 日志记录、游戏过程视频捕捉,以及覆盖数十个环境的公开基准结果。需要注意的是,它并不适合作为依赖库导入项目使用,更合适的定位是一本学习指南和一套实验工具箱。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目