#618 · 主分类: 教育与研究

PPO-PyTorch

deep-learning deep-reinforcement-learning policy-gradient ppo ppo-pytorch proximal-policy-optimization pytorch pytorch-implmention pytorch-tutorial reinforcement-learning reinforcement-learning-algorithms

PyTorch中裁剪目标近端策略优化(PPO)的极简实现

项目最后更新:07/09/24

GitHub Stars

2.4K

Forks数量

424

贡献者数量

6

许可证

MIT

收录理由

这个仓库用PyTorch简洁地实现了带裁剪目标的PPO算法,专为OpenAI Gym环境设计。整个训练循环、演员-评论家网络以及蒙特卡洛优势估计都浓缩在几百行代码里,没有框架干扰,每一部分都能轻松读懂。它刻意省略了GAE、并行采样和可学习的动作方差,并且在README中解释了每项简化的缘由,这让代码本身成了一份教学素材。附带的Colab笔记本以及用于记录日志、绘制曲线和从检查点生成gif的工具,让课堂演示或自学实验都能快速上手。它替代不了Stable-Baselines3这类生产级库,但足以清晰勾勒出PPO的真实工作流程。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目