谷歌DeepMind发布Gemini Robotics ER 2模型,最强具身推理能力支持多机器人协作

谷歌DeepMind发布Gemini Robotics ER 2模型,最强具身推理能力支持多机器人协作

昨日(7月30日),谷歌DeepMind宣布推出Gemini Robotics ER 2模型,这是其面向机器人领域的迄今最强具身推理模型。该模型被定位为机器人的“高级大脑”,能够协调处理与人类交流、理解物理世界并规划多步骤任务,随后将指令分派给更低层级的视觉-语言-动作模型执行具体操作。相比前代1.6版本,ER 2的最大突破在于支持连续视频流分析,机器人可据此实时追踪自身任务进度,在动作出错时自主调整或重试,并精准判断进入下一步骤的时机,同时模型还可原生调用Google Search或开发者自定义函数,极大拓展了实用边界。

在关键性能测试中,ER 2展现出卓越的推理精度。任务进度分类测试准确率达到57.4%,意味着机器人可在不重启整个工作流的情况下修正失败步骤;而在“关键时刻定位”测试中,模型需要找出如“何时停止倒咖啡”这类关键事件发生的精确视频帧,ER 2的准确率高达91.3%,平均绝对时间误差仅为0.96秒。更重要的是,该模型以更低计算成本达到接近更大模型的精度,执行速度达到前代的4倍,且满足亚秒级延迟要求,为现实场景中的安全运行提供了保障。

ER 2还引入了多机器人协作能力。不同类型的机器人可借助共享语义理解进行沟通和任务交接,完成单台设备难以独立处理的复杂工作流。谷歌展示了Apptronik的Apollo 2与Franka的FR3 Duo协作案例,验证了这一能力的实际价值。目前,Gemini Robotics ER 2已通过Gemini API和Google AI Studio面向开发者公开提供,同时在Gemini企业智能体平台中开启私密预览,谷歌还同步发布了模型配置和提示词示例代码,以降低开发者的接入门槛。

原创文章,作者:Google,如若转载,请注明出处:https://www.kejixun.co/article/758730.html

Google的头像Google认证作者

相关推荐

发表回复

登录后才能评论