✕

AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

通过门控与衰减的在线策略蒸馏提升OCR忠实度

事件

视觉语言模型在识别图像文字时,可能把图像中的异常文本改写成语言上更通顺的表达,从而损害OCR转录的忠实度。针对这一问题,研究者提出GAD-RL方法,在联合后训练过程中根据学生模型当前的任务表现和局部概率分布,自适应地调节教师模型的监督力度。

该方法使用一个冻结的教师模型,以参考转录文本和学生生成的前缀为条件。当某个响应组中出现任务奖励不低于0.95的输出时,GAD-RL会直接关闭蒸馏;随着组平均奖励升高,蒸馏强度被持续衰减。同时,前向KL散度会按学生对教师Top-1词元的概率进行加权,当学生对该候选词元的支持度较低时,减弱局部辅助更新。

在Qwen3.5-2B模型上,GAD-RL在CHAOS-Bench上取得59.92%的Micro Recall,分别比GRPO和固定权重的GRPO+OPD高出8.45和4.43个百分点,并在OmniDocBench v1.6上取得91.18的Overall分数。这一结果表明,动态调节教师监督比固定权重蒸馏更能兼顾OCR忠实度与整体文档理解性能,对需要高保真文字转录的文档处理场景具有实用价值。

来源

本条目由采集管线自动抓取并发布,完整内容见下方来源链接。

*采集源:arXiv cs.AI*

📎 原始来源:arXiv cs.AI
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容