Loading rl/ppo.py +1 −1 Original line number Diff line number Diff line Loading @@ -155,7 +155,7 @@ class PPO: # Optimize policy for multiple epochs: mb_losses, mb_vlosses, mb_plosses = [], [], [] batchsize = len(ret) if batchsize is not None else batchsize batchsize = len(ret) if batchsize is None else batchsize for e in range(epochs): permutations = torch.randperm(ret.size()[0]) # iterate over minibatches (mb) for stochastic updates Loading Loading
rl/ppo.py +1 −1 Original line number Diff line number Diff line Loading @@ -155,7 +155,7 @@ class PPO: # Optimize policy for multiple epochs: mb_losses, mb_vlosses, mb_plosses = [], [], [] batchsize = len(ret) if batchsize is not None else batchsize batchsize = len(ret) if batchsize is None else batchsize for e in range(epochs): permutations = torch.randperm(ret.size()[0]) # iterate over minibatches (mb) for stochastic updates Loading