星光澄海 | BLOG

统一多模态深度研究Agent OneSearch-VL 做对了什么

OneSearch-VL-8B比带工具调用的Qwen3-VL-8B,在两个新的多模态视觉基准上,分别高出20.2和17.6个百分点。同参数级别的模型,差十几个点已经是很明显的能力差距——这不是小修小补,是捅破了多模态深度研究的一层关键窗户纸。

它要解决的不是“看”,是“研究”

普通视觉语言模型(VL)能干的,无非是识别、描述图里的内容,要干“深度研究”就经常卡壳:比如给几张历史人物合影,普通模型能认出人是谁,但要查他们的关系、合影的时间出处,就没法把跨环节的信息串起来。之前的单图、多图、视频任务,各走各的逻辑,没有统一的研究框架,导致模型没法形成完整的推理链条。OneSearch-VL的核心,是把单图、多图、视频的深度研究归到同一个工作流里——不管哪种视觉输入,都要走视觉定位、外部检索、事实合成三步,这是它“统一”的根基,但真正难的是,要留住研究过程里的依赖关系:比如定位到图里的某个视觉锚点(像合影里的某个人),对应的实体关系、支撑关系的事实来源、最后合成答案的每一步,都要关联起来,不能断。

用VGEG把研究“结构化”,再用数据“喂明白”

它的秘密武器叫VGEG,直译是“视觉定位证据图”,直白说,就是把整个研究过程做成一张关联图——每个环节的依赖都标得清清楚楚,从视觉锚点到实体关系,再到外部检索的事实,最后到答案,全串成线。这东西是数据的骨架:他们用这个骨架构建了11万条SFT数据、1万条RL数据,还给RL训练做了专门的奖励函数,盯的就是“证据有没有追踪到”“视觉定位准不准”,避免模型为了凑答案瞎编。有了这套结构化的数据和奖励机制,模型的研究逻辑就不会跑偏,这也是它能拉开差距的核心原因。

对行业来说,这是补了一块“测试空白”

之前的多模态测试,要么是简单的看图问答,要么是视频动作识别,很少有针对“深度研究”的细粒度基准。这次OneSearch-VL带着两个新基准出来:OneSearch-MI-Bench和OneSearch-Video-Bench,这些基准里的问题,全是按研究过程的VGEG来设计的,相当于把“会不会严谨研究”的标尺给做出来了。实验数据也坐实了它的能力:比同参数带工具的Qwen3-VL-8B高了那二十个百分点,还在7个图像基准和VideoDR上有显著提升,甚至连GitHub仓库(appletea233/OneSearch-VL)都放出来了,相当于给行业递了个可复用的参考工具。

现在多模态模型都在往“通用”上卷,既要能聊天又要能画图还要能算题,但OneSearch-VL偏偏死磕“深度研究”这个细分方向。那未来,是做“什么都能凑一点”的通用模型更有竞争力,还是在“需要严谨查证”的场景里,这种结构化设计的模型更吃香?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI智能体、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown