











接之前的内容通过TensorBoard进行PPO参数优化
已经基本跑通强化学习的流程后,开始尝试自定义一个环境进行训练。
通过简单的环境进行尝试。
考虑过:
综上所属:找ai写一个贪吃蛇。✌️
然后找ai写了一个CustomEnv.py
根据之前的经验,训练了6次。
怎么说呢,感觉不是很理想。整体的训练虽然向着好的方向前进,但是有点,呃,🤔,波动感觉有点大。
如下图:

虽然成功的让ep_rew_mean变成了正数,但是出现了一些问题。
测试的时候发现:
😐,总计起来就是:训练的毫无意义。
通过检查,可以发现,最开始为了省事,使用ai生成的贪吃蛇代码,其中是有些问题的:
所以,总结一下,个人认为,进行PPO模型训练的时候,不应只是一味的调整模型参数进行训练,也要同步进行思考模型的训练环境所给的奖励反馈是否合理。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。