有效的大语言模型微调是否必须依赖人类可读文本?
事件
一项新研究探讨了大语言模型微调是否必须依赖人类可读的文本。研究者提出「期望更新对齐合成数据」(DASA)方法,利用冻结参考模型产生的激活梯度反馈,直接优化连续的合成输入嵌入,从而在不经过自然语言文本的情况下完成模型适配。实验覆盖 Llama 与 Qwen 两个家族共六个模型,参数规模从 1B 到 32B,评测基准涵盖知识、数学推理、代码生成和常识推理六项任务。
DASA 的核心思路是让合成嵌入对齐「有用的适配更新」,而非重建源文本或追求语言流畅度。在匹配的 LoRA 微调设置下,DASA 的性能与源自然语言数据相当,并在多种配置中实现超越,同时在多数对比中优于 GRADMM。研究还测试了通用领域与任务专用源数据两种场景。
值得关注的是,在相同峰值 GPU 显存下,DASA 相比 GRADMM 取得 3.6 至 4.9 倍的加速。这意味着未来微调数据可能不再需要以人类可读形式存在,连续嵌入本身即可承载适配信息,为数据合成与模型定制开辟了更高效的新路径。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:arXiv cs.AI*