在脑MRI数据集上,自闭症识别平均准确率做到75.9%;面部表情数据集上,这个数字是91.6%——这是刚出来的UniAR框架给出的结果,比现有最优方法还多涨了1.2到1.5个百分点。
旧方法的死穴:缺文本,语义推理做不了
自闭症是神经发育障碍,早诊对长期发育结果影响极大。但之前的自闭症识别方法卡了个硬瓶颈:诊断文本数据太少。没法拿到足够多“视觉特征+对应临床报告”的配对数据,只能死抠视觉分析——比如盯着脑区影像、面部特征看,但这样就做不出有临床意义的语义推理。相当于只摸到了“现象”,没get到“背后的逻辑”,识别的可靠性自然受限。
UniAR的核心玩法:多粒度提示补数据,多尺度对齐搭桥梁
针对缺文本的问题,UniAR用了多粒度提示学习的统一框架。它先是靠大模型生成词、短语、句子三个层级的分层诊断描述——相当于用AI补了配对临床报告的空缺,解决语义稀缺的问题。但光生成解释没用,得和实际视觉证据对上,所以又做了个混合专家的多尺度对齐模块:动态把量化后的视觉原型,和对应粒度的语义表示匹配起来,相当于给“AI生成的判断理由”和“真实的医疗影像”牵了线,避免生成的内容和实际对不上。
实测表现:四个基准都赢,鲁棒还可解释
实验覆盖脑MRI、面部表情两类场景的四个基准数据集,UniAR全面超过现有最优方法:MRI类基准平均准确率75.9%,面部类91.6%,比基线分别高1.5和1.2个百分点。而且它的框架是可解释的,不是黑箱——这对医疗场景太重要了,毕竟筛查需要的不只是“对不对”,还要知道“为什么对”。
当然,这只是arXiv上的预印本结果,离落地临床还有距离。不过话说回来,用多粒度提示补全临床文本的思路,会不会改变医疗AI“重视觉轻语义”的现状?或者说,当这种框架真用到一线筛查里,会不会让更多自闭症孩子被早发现?毕竟早诊的意义,是真的能改善孩子的长期发育轨迹的。
素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI应用落地、科研前沿
查看报道原文

发表第一条评论吧