AI导航

Reka 发布 Rho-1 全模态模型:一个网络同时生成视频并控制机器人

AI资讯
2 min read
1 次阅读

Rho-1 是 Reka 在 2026 年 10 月 5 日放出的研究预览:一个 19B 参数、从零训练的全模态推理模型,文本、图像、视频和机器人动作不再分给几个专门模型接力,而是被放进同一个神经网络、同一段上下文里处理。

它想拆掉的是接力棒

现在常见的多模态系统更像流水线:中间模型负责规划,再把画图、生成视频、检测目标等活分给各自的专家。每交接一次就多一层延迟,专家也只看到截取出来的一小段需求。Rho-1 的做法是把这些信号都写成 token,在一个共享状态里读写。官方演示中,同一场对话里它先画出一幅灯塔海岸图,再在图上框出灯塔、把画面动成视频、把天气改成暴雪,最后用文字说明两个版本差在哪,全程没有调用第二个模型,也没有走工具调用。

速度和训练规模

按 Reka 公布的口径,基础模型生成视频的中位速度约为实时的 0.79 倍,可观看的流大约 6 秒后开始;蒸馏版本把去噪步数从 99 步压到 8 步,短视频片段的生成被推进到接近交互的量级。值得注意的是它的训练账单并不大:全部结果来自一块用 320 张 H100 训练约三个月的检查点。Reka 把机器人动作也纳入同一表示,并用一个逆动力学模型从普通网络视频里反推控制信号,补机器人动作数据稀缺的短板。

限制写得很直白

这仍是研究预览,不是可直接部署的产品,官方自己列了四条短板:长时滚动时画面还鲜亮、空间结构却会先漂移;静态图上的目标定位可用,跨到视频里还不可靠;定向编辑在多样提示下容易不稳;原生视频分辨率目前封顶在 672×384。对做具身智能和交互仿真的人,它更适合用来判断统一架构这条路是否值得跟,而不是现在就替换掉已有的多模型管线。Reka 目前只开放合作联系,研究预览何时扩大范围还没有时间表。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。