Rho-1 是 Reka 在 2026 年 10 月 5 日放出的研究预览:一个 19B 参数、从零训练的全模态推理模型,文本、图像、视频和机器人动作不再分给几个专门模型接力,而是被放进同一个神经网络、同一段上下文里处理。
它想拆掉的是接力棒
现在常见的多模态系统更像流水线:中间模型负责规划,再把画图、生成视频、检测目标等活分给各自的专家。每交接一次就多一层延迟,专家也只看到截取出来的一小段需求。Rho-1 的做法是把这些信号都写成 token,在一个共享状态里读写。官方演示中,同一场对话里它先画出一幅灯塔海岸图,再在图上框出灯塔、把画面动成视频、把天气改成暴雪,最后用文字说明两个版本差在哪,全程没有调用第二个模型,也没有走工具调用。
速度和训练规模
按 Reka 公布的口径,基础模型生成视频的中位速度约为实时的 0.79 倍,可观看的流大约 6 秒后开始;蒸馏版本把去噪步数从 99 步压到 8 步,短视频片段的生成被推进到接近交互的量级。值得注意的是它的训练账单并不大:全部结果来自一块用 320 张 H100 训练约三个月的检查点。Reka 把机器人动作也纳入同一表示,并用一个逆动力学模型从普通网络视频里反推控制信号,补机器人动作数据稀缺的短板。
限制写得很直白
这仍是研究预览,不是可直接部署的产品,官方自己列了四条短板:长时滚动时画面还鲜亮、空间结构却会先漂移;静态图上的目标定位可用,跨到视频里还不可靠;定向编辑在多样提示下容易不稳;原生视频分辨率目前封顶在 672×384。对做具身智能和交互仿真的人,它更适合用来判断统一架构这条路是否值得跟,而不是现在就替换掉已有的多模型管线。Reka 目前只开放合作联系,研究预览何时扩大范围还没有时间表。