在MIMIC-IV临床数据集上,ViSTA模型的表现有点意思:急性肾损伤和死亡率预测的4项核心指标,它排所有适配方法第一,可训练参数却只有51.6万。
不是换大模型,是加个“适配器”就搞定
之前的临床AI分两类:一类是专门算风险的预测模型,只输出一个数值;一类是懂文本的大模型,能答医学问题,但看不懂血压、心率这种散点式的临床时序数据。想把这俩打通,要么训个超大的临床专属模型,成本爆炸;要么直接凑合用,性能不够。ViSTA走了第三条路:它是个紧凑的适配器,根本没碰预训练多模态模型的原有参数,只负责把不规则的临床数值,转成模型能识别的视觉token,还能微调修正这些token的偏差。相当于给大模型加了个“时序数据翻译官”,训起来省事儿多了。
参数少九成,性能追上GPT-5.6 Sol
拿数说。20亿参数的ViSTA,做急性肾损伤预测的ROC-AUC是0.7376;对比的GPT-5.6 Sol用的是纯文本输入,推理要费更多劲,结果是0.7380,几乎打平。再看时序问答,40亿参数的ViSTA准确率69.27%,比常用的低秩适配方法少用90%的可训练参数,准确率差2.82到4.88个点。说白了,轻量版ViSTA的核心任务性能,已经能追上参数大得多、成本高的竞品。
给临床落地,开了个小口子
之前聊临床大模型,总绕不开“算力不够”“数据难训”的问题。ViSTA的思路太实在:不用重新训整个大模型,加个小模块适配临床时序数据,就把风险预测和患者状态变化的问答打通了。对想落地的团队来说,不用砸钱训万亿级模型,拿现有多模态模型加个ViSTA就能测,成本低、周期短。
当然,它和顶级模型还有点差距,但参数优势太诱人了。如果后续能把问答的准确率再提一提,会不会先落地到基层医院的辅助诊断?毕竟基层算力有限,轻量模型才好推广啊?
素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI应用落地、科研前沿
查看报道原文

发表第一条评论吧