星光澄海 | BLOG

EgoVoice:从第一视角流里主动说话的AR助手

AR助手主动搭话这件事,目前做得特别差。哪怕是零样本的基础模型,也很难踩中你真正需要提示的点——要么早了帮不上忙,要么晚了根本没用。直到arXiv那篇归类在cs.CL、cs.CV、cs.SD的论文,拿出了叫EgoVoice的新框架。

从脱节到联合,EgoVoice补了什么空白

之前的穿戴式AR助手,各模块都有进展:主动视频助手能盯第一视角的画面,口语对话系统会聊天,自我中心任务理解能猜你在做啥,但没人碰核心问题——什么时候说、说什么。EgoVoice就是针对这个联合问题做的。它用HoloAssist里真实人类导师的第一视角录像,先把音频拆干净、重合成标准语音,再把每段会话变成“每个时刻都要选:沉默还是说提示”的训练题。微调多模态大模型后,还直接用偏好优化改了它爱乱说话的毛病。

实验结果:真的比旧模型强

论文里的实验很直接:不管是闭源还是开源的现有模型,都很少能做出时机准、内容有用的主动干预。但EgoVoice在三个维度全有提升——干预时机更对,说的话更贴合当下场景,而且更符合人类的偏好。简单说,它真的知道什么时候该搭话,说的话也不废话,不会像有些模型那样,用户刚弯腰捡手机,就突然冒出来一句“要不要买个手机壳”。

对穿戴式AR来说,这是个关键突破吗

现在的AR助手大多是被动的——你得喊“小助手”才会动,或者点一下才出提示。主动交互是下一个方向,但之前一直卡在“时机判断”上:要么瞎提醒,要么不敢说。EgoVoice的思路是,把真实人类导师的互动经验(比如老师教学生做实验时该什么时候提醒),变成模型能学的训练数据,再用偏好优化让它学会“不说多余的话”。对想做穿戴式AR的厂商来说,这至少提供了一个可行的框架,不用再自己从零攒数据。

我在想,要是未来你戴的AR眼镜能主动跟你说“前面路滑”“手里拿的东西要掉了”,你会愿意接受这种“主动搭话”吗?毕竟,没人喜欢被过度打扰,但也没人希望需要提示的时候,助手默不作声。


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown