广义优势估计(Generalized Advantage Estimation,GAE)
          Warning:这是一篇GPT-based笔记  在强化学习中,广义优势估计(Generalized Advantage Estimation,GAE)是一种对优势函数进行平滑估计的方法,通过对不同步长的时序差分残差(TD residual)按指数加权累积,以在偏差-方差权衡上取得最佳效果。GAE引入了参数控制权重,当时退化为单步TD(0),可获得低方差、高偏差的估计;当时退化为蒙特卡洛回报,