谷歌 DeepMind 于7 月 30 日发布 Gemini Robotics 2 系列模型,首次实现对完整人形机器人的全身智能控制。系列包含三个模型:视觉-语言-动作模型可控制人形机器人从脚到指尖完成行走、下蹲、抓取等动作;具身推理模型 ER 2 作为机器人的「高层大脑」,可规划持续数分钟、涉及数百次决策的多步任务;端侧模型可本地运行,仅需几小时、通常不到 200 个示例即可适配全新机器人本体。
谷歌 DeepMind 于7 月 30 日发布 Gemini Robotics 2 系列模型,首次实现对完整人形机器人的全身智能控制。系列包含三个模型:视觉-语言-动作模型可控制人形机器人从脚到指尖完成行走、下蹲、抓取等动作;具身推理模型 ER 2 作为机器人的「高层大脑」,可规划持续数分钟、涉及数百次决策的多步任务;端侧模型可本地运行,仅需几小时、通常不到 200 个示例即可适配全新机器人本体。