Odyssey 开放世界模型 Odyssey-3 的公开研究预览并可免费试用
Odyssey-3 is a new generative world model that you can try for free
Odyssey 已开放世界模型 Odyssey-3 的公开研究预览,免费在线演示 Odyssey-3 Flash 可根据文字提示实时生成并探索交互环境。
Odyssey 正在公开其世界模型 Odyssey-3。据该公司称,它能实时生成可交互世界,并在物理基准测试中取得最高分。
总部位于加利福尼亚的人工智能公司 Odyssey 已推出其世界模型 Odyssey-3 的公开研究预览版。用户可根据文本提示生成可交互环境,并实时进行探索。该模型会模拟物理过程,并根据特定动作预测环境如何变化。开发者可以申请 API 访问权限。
创始人 Oliver Cameron 与 Jeff Hawke 于 9 月 15 日首次公布该模型,重点面向机器人、自动驾驶和电子游戏。现在的新内容是公开访问、更多技术细节以及基准测试结果。
你现在就能试用的交互式 AI 世界
免费在线演示运行在 Odyssey-3 Flash 上。该模型可根据文本描述生成可交互环境。用户可选择第一人称或第三人称视角,在生成的世界中移动、触发事件,并实时观看模型的响应。
Odyssey-3 基于自回归扩散 Transformer 构建,会根据先前的帧和用户动作持续生成新的视频帧。据 Odyssey 称,该模型在训练期间从视觉观察中学习物理关系与因果关系。
训练数据包括带事件描述的互联网视频、与相应键盘和鼠标输入配对的电子游戏画面,以及模拟的物理交互。一种额外的训练技术减少了所需计算步骤的数量,使实时生成成为可能。
根据官方基准测试提交,基础版 Odyssey-3 模型拥有 140 亿个参数,并以 832 × 480 像素生成视频。Odyssey-3 Pro 支持 1280 × 720 像素。
物理基准测试的成绩声明附带保留条件
据该公司称,更强大的 Odyssey-3 Pro 在来自 Physics-IQ Verified 的视频到视频基准测试中获得 66.1 分。该测试评估流体力学、光学、固体力学、磁学和热力学等领域的物理行为。模型必须续接真实世界实验的视频,其输出会与实际结果进行对比。
不过,66.1 分这一最高成绩附带一个很大的保留条件。它来自单次测试运行,其中一种筛选方法会为每项任务从八段生成视频中选出一段。基准测试规则要求,任何纪录声明都必须进行四次测试运行并报告标准差。所报告的纪录并未达到该标准。若不使用该筛选方法,Odyssey-3 Pro 在四次运行中的平均分为 63.37。两项结果均出现在官方排行榜上,但都是由 Odyssey 自行提交的。

在 WorldMark 基准测试上,基于其自身评估,Odyssey-3 在四个类别中的三个位列第一:第一人称风格化(77.2)、第三人称真实(79.0)和第三人称风格化(76.3)。在第一人称真实中,它以 80.6 分位列第三。WorldMark 测试模型对控制指令的遵循程度、生成图像的观感,以及模拟世界是否随时间保持一致。
一个面向机器人、无人机和 GTA V 的模型
Odyssey 希望在不同任务中使用同一个世界模型,从操控机械臂、导航无人机到控制游戏角色。针对每一种应用,该模型都会搭配一个专门的控制器,将其预测转化为具体指令。
据该公司称,在测试中,基于 Odyssey-3 构建的 AI 控制了多条机械臂。几十个小时的演示数据就足以用于训练。机器人还能自行从抓取失败中恢复,尽管这些情况并不在训练数据中。
在人形机器人方面,Odyssey 正与瑞士机器人公司 Flexion 合作。据称,Flexion 基于 Odyssey-3 构建的控制器比对照模型表现更可靠,即使在条件发生变化时也是如此。
Odyssey 还构建了一个基于模拟飞行数据训练的无人机控制器。据该公司称,在虚拟室内环境中,无人机能够躲避障碍物,并按指令飞向特定目标。
Odyssey-3 也能玩电子游戏。该公司展示了一款 AI 自主游玩 GTA V、驾驶载具并与敌人战斗。一个用大约两小时 GTA 画面训练的控制器,还能在无需任何额外训练的情况下将技能迁移到 Red Dead Redemption 2,操控角色骑马移动。
Odyssey 还计划用其世界模型来训练 AI 智能体。在一次演示中,一个 AI 智能体接收了自然语言任务,并试图在 Odyssey-3 生成的环境中通过自身行动完成该任务。目标是让智能体从自身行动的结果中学习,这可能是一种全新的 AI 训练范式。
目前,公开研究预览版提供交互式环境生成,机器人与自主系统仍需进一步的工作。
打造世界模型的竞赛
Odyssey 由 Oliver Cameron 和 Jeff Hawke 于 2023 年创立。2026 年 6 月,该公司从包括 Amazon 和 AMD Ventures 在内的投资者处 筹集了 $310 million。
世界模型旨在让 AI 系统理解空间与物理关系。Google DeepMind 正通过 Genie 3 采取类似方法来生成交互式世界。World Labs 是由 Fei-Fei Li 创立的初创公司,正在开发类似技术。AMD 于 9 月下旬宣布,计划以约 $8.2 billion 收购 World Labs。
没有炒作的 AI 新闻 – 由人工策展
订阅 THE DECODER,即可享受无广告阅读、每周 AI 通讯、每年六期独家 "AI Radar" 前沿报告、完整存档访问权限,以及评论区访问权限。
来源:The Decoder · the-decoder.com