#618 · 主分类: 教育与研究
PPO-PyTorch
PyTorch中裁剪目标近端策略优化(PPO)的极简实现
项目最后更新:07/09/24
GitHub Stars
2.4K
Forks数量
424
贡献者数量
6
许可证
MIT
收录理由
这个仓库用PyTorch简洁地实现了带裁剪目标的PPO算法,专为OpenAI Gym环境设计。整个训练循环、演员-评论家网络以及蒙特卡洛优势估计都浓缩在几百行代码里,没有框架干扰,每一部分都能轻松读懂。它刻意省略了GAE、并行采样和可学习的动作方差,并且在README中解释了每项简化的缘由,这让代码本身成了一份教学素材。附带的Colab笔记本以及用于记录日志、绘制曲线和从检查点生成gif的工具,让课堂演示或自学实验都能快速上手。它替代不了Stable-Baselines3这类生产级库,但足以清晰勾勒出PPO的真实工作流程。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
prompts.chat
前身为 Awesome ChatGPT Prompts。分享、发现和收集社区提示词。免费且开源——可自托管,为您的组织提供完全隐私。
JavaGuide
Java 面试 & 后端通用面试指南,覆盖计算机基础、数据库、分布式、高并发、系统设计与 AI 应用开发
system-prompts-and-models-of-ai-tools
精选流行AI助手和编码代理的系统提示、内部工具和AI模型集合。
30-seconds-of-code
编程文章,助你提升开发技能
generative-ai-for-beginners
21节课,开始使用生成式AI构建