教学知识还是临床病例?数据类型如何塑造医疗大语言模型
事件
医疗大语言模型通常混合使用教学数据(如教科书)与临床数据(如患者病历)进行训练,但两类数据各自如何塑造模型能力此前并不清楚。一项研究通过匹配词元量的对照实验,调整教学数据与临床数据的比例,系统分析数据构成对知识密集型任务和临床导向任务的表现、能力画像及错误模式的影响。
研究发现,两类数据之间存在不对称迁移:临床数据能提升临床导向任务,同时在知识密集型任务上保持竞争力;教学数据则主要提升知识密集型任务。错误分析显示存在“知易行难”的差距,即知识回忆能力的提升并不能可靠地转化为临床推理能力。此外,少量临床数据即可在基于电子病历的任务上带来大部分收益,而最优混合比例随下游任务对知识与临床推理的需求而变化。
这些发现提示,医疗大语言模型的数据治理应以应用为导向:面向推理密集型场景时,应偏好更高比例的临床数据。对模型开发者与医疗机构而言,这意味着数据配比不应一刀切,而需根据实际部署任务的知识与推理需求来定制。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:arXiv cs.AI*