星光澄海 | BLOG

Reka发布19B模型Rho-1 单系统支持多模态与机器人动作

Rho-1有一段未经编辑的演示会话:5轮交互里,它先画了一座灯塔,给灯塔加了边界框,把灯塔做成动画视频,再把视频变成暴风雪场景,最后解释前后差异。全程没调用其他工具,也没切换模型,全靠它自己完成。

打破多模态管道的“手交接”问题

现在大部分多模态系统都是管道式的:一个中心模型做规划,然后把任务交给专门的模型处理——文本归文本,图像归图像,视频归视频,检测归检测。每一次交接都会增加延迟,而且每个专门模型只能看到狭窄的请求范围,没法兼顾全局。

Rho-1直接砍掉了这些交接环节。文本、视觉、机器人动作,都变成同一个上下文窗口里的token,不需要在不同模型间转来转去。Reka的测试数据显示,这种设计有明显的速度优势:生成第一个视频片段,Rho-1要7.0秒;而多模型管道的同类测试是13.8秒。

双流架构:一个模型搞定多格式输入输出

Rho-1的核心是双流设计,每个transformer模块里有两个专家权重流,共享注意力机制和同一套KV缓存。

输入和输出分成两种原生格式:离散token对应文本、符号推理和高级指令;连续token对应图像潜变量、视频帧、机器人动作和本体感知数据。

理解流负责语言和视觉解析,生成流负责把潜变量去噪成图像或视频。训练时,离散序列用next-token预测,连续输出用流匹配算法。这种设计有实际好处:不用额外的检测器,边界框直接是坐标token;视频第一帧也不用重新编码,直接复用上下文里的图像表示。

Rho-1是19B参数的模型,从头训练,用了320张H100,花了3个月时间。目前支持的视频分辨率上限是672×384。

速度与落地:从研究预览到机器人应用的可能性

Rho-1的基础模型生成视频的速度是0.79倍实时,第一个可观看的流大概6秒出来。还有一个蒸馏版本,把去噪步骤从99步砍到8步,质量损失很小,第一个5.3秒的视频片段只花了约1秒,和最快的专用图像模型速度接近,也是所有测试模型里生成第一个文本token最快的(这些是厂商内部测试,没有独立基准验证)。

机器人方向,Rho-1直接输出原生连续动作token,不用中间转换。在LIBERO模拟环境里,它能生成7个动作通道。为了应对机器人领域稀缺的遥操作日志,Reka给Rho-1配了自己的逆动力学模型,能从原始视频里推断控制信号。

对比市面上同类模型,Rho-1的特点很明确:原生支持机器人动作,而ByteDance的BAGEL只支持文本和图像,Baai的Emu3.5做交互式视频,Google的Genie3是720p 24fps的原生视频生成,还支持实时转向和提示式世界事件。这些对比数据的验证时间是2026年10月5日,来自官方来源。不过Rho-1目前只是研究预览,没有公开的权重、API或定价。

Rho-1的优势在于统一了多模态任务,不用模型间交接。但目前的局限也明显:视频分辨率不高,而且还没落地到普通开发者手里。如果未来它能提升分辨率,再开放更多功能,会不会让更多领域的应用,从依赖多模型管道转向统一的单模型系统?还是说,架构本身的限制,会让它的落地速度跟不上预期?


素材来源:MarkTechPost · AI情报、大模型、具身智能、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown