星光澄海 | BLOG

《从奖励信号到视觉效用:医学VLM的一次可控审计》

在PMC-VQA数据集的2000道干净测试题上,研究者对Qwen2.5-VL-3B做了一次可控训练审计。

《这次审计比了5种主流训练路径》
研究选了医学VLM后训练常用的5种方法:监督微调(SFT)、仅调语言模型的低秩适配(LoRA)、把适配范围扩大到多模态、只针对答案的GRPO,还有反事实证据目标。所有变量都控制住了,属于很严谨的对照审计。

《准确率涨了,但视觉效用掉了》
仅语言LoRA的SFT效果最有戏剧性:它把正确图像的识别准确率拉了1.1个百分点,可视觉效用事件反而少了2.4个,图像敏感性直接降了5.6个点。配对记录显示,训练后有155个视觉效用事件被保留,却有203个失效了。
扩展多模态适配的结果更糟,正确图像准确率比仅语言LoRA的SFT还低。标准GRPO的情况说不准,干净测试集的准确率变化是不确定的——这可能和它混合奖励组、参数更新的方式有关。还有个细节:规范选项的得分路径,和生成答案的token路径完全不重合。

《医学VLM的训练,不能只盯答对不对》
研究者戳破了一个常见误区:现在多数医学VLM只看答案准确率的训练,和真正能落地的视觉效用之间差了一大截。反事实证据目标在训练集上有提升,但和标准GRPO的差异,在验证集上匹配训练剂量后还是没体现出来。单样本分析还能看到,训练过程里证据得分、决策边际、生成答案的联动变化,远没达到优化目标的预期。

医学VLM要落地,得先过“视觉效用”这关。那未来的训练,到底该把答案准确率放在核心,还是把视觉效用当成硬指标?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI应用落地、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown