Google机器人能双机配合了:Gemini 2.0想让机械手真正派上用场

2次阅读

Google扔出了一个新版本的大模型——专门给机器人用的那种。

Gemini Robotics 2发布了,包含三个子模型,其中只有一个现在开始公开向开发者提供。这次的重点有两个:手部动作更灵活了,多台机器人能配合干活了。

先说"灵巧"这件事。

人类的手有27个自由度,每根手指都能独立控制,指尖触感能告诉你咖啡杯有多烫。以前的机器人做精细操作,要么靠预编程的动作序列,要么需要人类不断纠正。Gemini Robotics 2想改变这个局面。

它旗下有个叫ER 2的"具身推理"模型,本质上是个视觉-语言模型,负责理解指令和周围环境。最大的升级是它现在能实时处理机器人摄像头的画面,在任务执行过程中持续跟踪进度。比如让它倒一杯咖啡,它能识别什么时候该停手——准确率接近90%,比上一代1.6版本高出不少。

它还能实时发现失败并重新尝试。球滚走了,手移歪了,不需要从头开始,直接调整手位继续干。

多机配合是另一个亮点。

Google放出的演示视频里,Apollon 2和Franka F3 Duo两台机器人同时在一个任务流程里工作,互相不撞车。视频是实拍,没有加速,看起来它们确实在协调彼此的动作——虽然速度还是比真人慢很多。

这背后的逻辑是:ER 2负责理解,ER 2理解完任务后,把指令转交给另一个叫Gemini Robotics 2的视觉-语言-动作模型,由它生成具体的机器人动作序列,类似于AI生成文本或图片的方式,只不过输出的是机械动作。

还有一个低延迟的本地版本,叫Gemini Robotics On-Device 2,这个目前只在少数测试者手里。

类比一下的话,这就像是从"你教它每个动作"进化到了"你告诉它要什么结果,它自己想办法做到"。离真正的通用机器人还有点距离,但显然比两年前的产品更像样了。

机器人什么时候能进你家帮你做饭洗衣服?这个问题还没人能回答。但至少现在,它的手不会动不动就把东西摔地上了。

正文完
 0