通过门控与衰减的在线策略蒸馏提升OCR忠实度
事件
视觉语言模型在识别图像文字时,可能把图像中的异常文本改写成语言上更通顺的表达,从而损害OCR转录的忠实度。针对这一问题,研究者提出GAD-RL方法,在联合后训练过程中根据学生模型当前的任务表现和局部概率分布,自适应地调节教师模型的监督力度。
该方法使用一个冻结的教师模型,以参考转录文本和学生生成的前缀为条件。当某个响应组中出现任务奖励不低于0.95的输出时,GAD-RL会直接关闭蒸馏;随着组平均奖励升高,蒸馏强度被持续衰减。同时,前向KL散度会按学生对教师Top-1词元的概率进行加权,当学生对该候选词元的支持度较低时,减弱局部辅助更新。
在Qwen3.5-2B模型上,GAD-RL在CHAOS-Bench上取得59.92%的Micro Recall,分别比GRPO和固定权重的GRPO+OPD高出8.45和4.43个百分点,并在OmniDocBench v1.6上取得91.18的Overall分数。这一结果表明,动态调节教师监督比固定权重蒸馏更能兼顾OCR忠实度与整体文档理解性能,对需要高保真文字转录的文档处理场景具有实用价值。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:arXiv cs.AI*