谷歌刚发布Gemini Omni——这是他们迄今响应速度最快的多模态模型,延迟压到了100毫秒以内。人类眨眼的时间大概是300毫秒,也就是说,它的反应比眨眼还快三分之一。
不是升级,是把多模态拉进了实时
之前的多模态模型,不管是Gemini还是GPT-4,大多是“先攒输入,再出结果”。比如你拍个图发过去,等它识别完图像、解析完文字,再给答案,中间的延迟通常在几百毫秒甚至几秒。Gemini Omni不一样,它把延迟砍到了100ms以内,而且支持语音、视觉、文本的无缝切换。你对着手机说“这个图标是什么”,同时用手指点屏幕上的图标,它能同步识别你的语音指令和视觉指向,不用你重复解释,也不用等它“攒齐信息”。我上周试了下官方demo,问“这个按钮按了会跳去哪”,手指刚离开屏幕,它的回答已经传过来了,几乎没间隙。
关键门道:从“处理”到“交互”的门槛
为什么延迟能压这么低?核心是谷歌对多模态模型的底层架构做了调整。之前的多模态模型,是把视觉和语言两个模块分开,各自处理后再融合,中间要转两次数据,自然慢。Gemini Omni是把视觉编码和语言理解做了端到端的融合,相当于同一套模型同时处理两种信息,不用额外转换,这就省了不少时间。对开发者来说,这是个明显的利好:之前要做实时多模态应用,得自己搭算力集群,调模型参数,小团队根本玩不起;现在调用Gemini Omni的API,就能拿到毫秒级的实时交互能力,不用再花几个月的时间搭底层,甚至能把应用的响应速度从秒级拉到亚秒级。
对玩家来说,这是张重新洗牌的牌
谷歌选在这个时间点推Gemini Omni,明显是冲着OpenAI的GPT-4o来的。GPT-4o的实时多模态功能已经上线了一段时间,但谷歌把延迟压到了100ms以内,比GPT-4o的平均延迟还低一些。对普通用户来说,影响是隐形的:你用谷歌助手问问题,不会再出现“你刚说什么?我没听清”之后的卡顿,指哪问哪,反应几乎跟朋友对话一样自然。对企业开发者来说,这意味着他们能做更多场景的应用:比如实时的工业质检,工人用摄像头拍零件,AI能马上指出问题;比如实时的客服,用户指一下商品,AI马上讲清楚功能,不用再查后台资料。不过谷歌也有隐忧:之前Gemini在中文语境下的表现一直不如GPT系列,这次Omni会不会补这个短板,还得看实际测试结果。
当多模态的延迟压到100毫秒以下,你会愿意把更多实时交互的事交给AI吗?
素材来源:Google DeepMind Blog · AI情报、大模型
查看报道原文

发表第一条评论吧