The Decoder· Matthias Bastian·· 5 小时前AI 评分49
Reka AI 全模态模型 Rho-1 在单一模型中处理文本、图像、视频与机器人控制
Reka AI's omni-model Rho-1 handles text, images, video, and robot control in a single model
AI 导读
Reka AI发布了全模态模型Rho-1的研究预览版,这款190亿参数模型在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。它不像多数AI系统那样把任务路由给专用模型,而是把全部模态当作token放进同一个共享上下文窗口,且不调用工具或外部模型。
正文 · AI 翻译
Reka AI 已发布 Rho-1 的研究预览版。这一拥有 190 亿参数的全模态模型在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。与大多数将任务路由到专用模型的 AI 系统不同,Rho-1 将所有模态作为 token 放在同一个共享上下文窗口中运行,无需工具调用或外部模型。该模型可实时生成连续视频,并能即时响应新指令,无需重新启动。
用于预测摄像头图像的同一套权重也驱动机器人运动。为应对稀缺的机器人训练数据,Reka AI 构建了一个逆动力学模型,从普通互联网视频中提取控制信号。Rho-1 在 320 块 H100 GPU 上训练了约三个月。
Reka AI 并非多模态 AI 领域的新来者。2024 年 4 月,该公司推出了Reka Core,这是一款在基准测试中与 GPT-4、Claude 3 和 Gemini Ultra 竞争的多模态语言模型。此次发布契合AI 研究向所谓世界模型更广泛推进的趋势。
无炒作的 AI 新闻 – 由人工精选
订阅 THE DECODER,即可享受无广告阅读、每周 AI 通讯、每年六期独家 "AI Radar" 前沿报告、完整存档访问权限,以及评论区访问权限。
来源:The Decoder · the-decoder.com