站内内容与 AI 工具一站式检索。
研究提出GAD-RL方法,在联合后训练中根据学生模型当前表现自适应调节教师监督强度,避免固定教师指导随学生进步而失效,在CHAOS-Bench上Micro Recall达59.92%,显著优于GRPO基线。