站内内容与 AI 工具一站式检索。
论文提出正则化强调时序差分学习(RETD),通过归一化一阶冲击后修复机制,在保持迹与重要性比不变的前提下改善恒定步长下的采样动力学稳定性,并证明调和递减步长的几乎必然收敛及条件矩收缩结果。