The Decoder· Matthias Bastian·· 1 天前AI 评分72
Reka AI 发布 Rho-1 单模型同时处理文本图像视频及机器人控制
Reka AI's omni-model Rho-1 handles text, images, video, and robot control in a single model
AI 摘要
Reka AI 发布了名为 Rho-1 的 190 亿参数全模态模型预览版,该模型在一个共享上下文窗口内将文本、图像、视频和机器人控制动作全部作为 token 处理,无需外部工具调用或路由至专用模型。这一架构使得模型能够实时生成连续视频并即时响应新指令而无需重启,且同一组权重既能预测相机图像又能驱动机器人运动。
为克服机器人训练数据稀缺的问题,Reka AI 构建了一个逆动力学模型,从普通互联网视频中提取控制信号。该模型在约三个月的训练周期内使用了 320 块 H100 GPU 进行训练。此前 Reka AI 曾于 2024 年 4 月推出过 Reka Core 多模态语言模型,此次发布被视为向所谓“世界模型”方向推进的一部分。
事实层面确认了 Rho-1 的单模型架构及其在视频生成与机器人控制上的能力,推断其可能降低多模态系统的工程复杂度,但猜测其实际推理延迟与单位经济成本仍需更多实测验证。
来源:The Decoder · the-decoder.com