MMAD基准上,工业缺陷定位的人类专家准确率是92.3%,但训练过的领域专家最多只有75.5%——甚至部分训练模型的异常检测准确率还不如没训过的基础模型。
仅领域内训练的坑:越训越弱?
针对多模态工业异常理解(MM-IAU),研究者试了个常规方案:用领域内数据训多模态大模型(MLLM),结果发现走偏了。在MMAD这个行业常用基准里,训过的领域模型定位缺陷的准确率最高才75.5%,比人类专家差了17个点还多。更离谱的是,有些训过的模型,异常检测的准确率居然比没训的基础模型还低——相当于学了半天,连原始版本都不如。
互补模型也救不了:跨模型的共性短板
不同的MLLM各有长处,比如有的擅长描述缺陷,有的擅长推理原因,但它们在细粒度感知上都有共同的硬伤。研究者把这些互补模型拼在一起,想补短板,结果没用。组合模型还是解决不了MM-IAU里同时要做检测、定位、描述、推理的多重任务要求——单模型不行,硬拼也不行。
SiGMA的解法:分工比堆量有用
研究者搞了个叫SiGMA的框架,思路不是堆大模型,而是拆任务分工。它把工作分成三个角色:多模态搜索器提供工业知识和正常样本;缺陷专家把查询和参考样本的对比转成精准的异常证据;无标签可靠性控制器按任务能力和证据质量,权衡各角色的输出权重。
效果呢?SiGMA在MMAD上的平均准确率是85.2%,比最强的训过的领域模型高了4个点,比Gemini-2.5-Pro也高,和人类专家只差1.5个点。更关键的是,就算用三个最大9B参数的小模型做代理,SiGMA也能拿到84.4%的准确率——新的MLLM加进来也不用重新训练。
落地的启发:小模型也能凑出好效果?
工业场景里,很多公司没财力堆千亿级大模型,SiGMA的思路其实是个务实方向:不用单模型全能,靠分工和各角色的能力互补,小模型也能做出接近人类的效果。那是不是以后工业异常理解的方案,不用追大参数,反而要盯着任务分工的框架设计?
素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI智能体、科研前沿
查看报道原文

发表第一条评论吧