Microsoft Research:真实世界物理 AI 机器人的推理卸载
Microsoft Research 发现,把物理 AI 推理卸载到边缘或云端 GPU 可提升任务表现。在内存足够时,建图与规划比 A100 最多慢 383%,较轻 GPU 使障碍及时检测降 30%,较小 GPU 使 VLA 准确率降 50%。Jetson Thor 等较大机载 GPU 可使耗电增加最多 160%。
Microsoft Research 发现,把物理 AI 推理卸载到边缘或云端 GPU 可提升任务表现。在内存足够时,建图与规划比 A100 最多慢 383%,较轻 GPU 使障碍及时检测降 30%,较小 GPU 使 VLA 准确率降 50%。Jetson Thor 等较大机载 GPU 可使耗电增加最多 160%。
NVIDIA与合作伙伴在AI Day Singapore展示东南亚AI进展。泰国iApp Technology用NeMo微调Nemotron 3 Nano并开源,法律助手Thanoy已服务约43,000名用户。越南Viettel AI广泛微调Nemotron 3 Super,该模型在VMLU与内部产品基准中排名最高。
Google DeepMind 今天发布 Gemini Robotics ER 2,将其作为机器人的高层具身推理模型,用于对话、理解物理世界和多步规划,再把运动执行交给下层视觉语言动作模型。
推荐理由:新模型相对 ER 1.6 补上了连续视频中的进度判断与多机协作能力,开发者可把它接到下层动作模型来编排多步实体任务。
Google DeepMind 推出 Gemini Robotics 2,把视觉和语言输入转成电机控制,让完整人形机器人和双臂机器人完成从脚到指尖的全身动作与灵巧操作。
推荐理由:这次更新把原先的桌面上半身操作扩展到全身协调、灵巧操作和多机协作,并说明端侧模型可用数小时数据适配新机体。
Mistral 发布 8B 模型 Robostral Navigate,仅凭单目 RGB 相机和自然语言指令让机器人自主导航,在 R2R-CE 验证集未见环境达到 76.6% 成功率。
GRASP 是面向学习得到的动力学(世界模型)的新型梯度规划器,靠三项设计让长时域规划变得可行。它将轨迹提升到虚拟状态,使优化可沿时间并行;把随机性直接加进状态迭代用于探索;并重塑梯度,让动作获得干净信号,同时避开高维视觉模型中脆弱的 state-input 梯度。