星光澄海 | BLOG

Gemini 3.8 Live带实时虚拟形象:AI交互的新落点?

谷歌刚放出来的Gemini 3.8 Live,这次带了个叫Live Avatar的功能——不是那种上传后就不动的静态头像,是和语音节奏、表情完全同步的实时虚拟形象。

不是换个脸,是交互的维度变了

之前的AI语音交互,不管是Siri还是GPT,都是“你说→它答”,信息只通过耳朵进。这次的Live Avatar,相当于把“看”的通道打通了。比如你问它“最近的咖啡馆在哪”,它不仅给你念路线,还会微微偏头,指尖在虚拟地图上点一下;你吐槽“今天加班好累”,它会皱下眉,语气软一点,配个耸肩的动作。不是事后生成的动画,是实时和语音匹配的——这个细节很关键,之前的虚拟形象都是静态或半动态,和语音脱节,这次是真的“同步”,属于Live交互的一部分。

对谷歌来说,这步踩在了哪里?

Gemini系列现在是谷歌压在AI交互落地的核心牌。之前和GPT比,谷歌的实时交互(Live)在响应速度上有优势,但多模态的落地一直慢半拍。这次把Live Avatar嵌进去,等于把“沉浸式交互”的入口补全了。之前大家聊AI交互,要么是文字聊天框,要么是语音,很少有“面对面”的感觉——哪怕是虚拟的,Live Avatar就是补了这个空白。对用户来说,和一个会动、会有表情的AI聊天,比对着对话框打字,代入感强太多。

这算行业的新趋势吗?

之前Meta、OpenAI都在提虚拟化身,但大多是绑定社交或元宇宙场景,没和实时AI交互深度结合。谷歌这次把Live Avatar做成Gemini 3.8 Live的核心功能,等于给其他玩家提了个醒:AI交互的下一个竞争点,不再是“能不能听懂”,而是“能不能让交互更像真实的人”。比如以后你用AI做会议助手,它会实时投影出你的虚拟形象,帮你做手势提示;或者用AI做心理陪伴,它的表情会跟着你的情绪变——这些场景,之前只能靠想象,现在Gemini已经露了个雏形。

当AI的交互从“纯声音”变成“连表情都同步”,你会愿意对着一个会动的虚拟脸聊天,还是依旧喜欢敲键盘打字?


素材来源:Google DeepMind Blog · AI情报、大模型、AI应用落地、消费级AI
查看报道原文

发表第一条评论吧

支持 Markdown