机器人不再只是机械臂
在过去的几年当中, 我们所见到的绝大多数机器人演示均聚焦于机械臂之上, 它们具备抓取物品以及组装零件的能力, 然而其下半身基本上处于固定状态, 谷歌此次所推出的Gemini Robotics 2模型, 其核心突破之处在于达成了全身控制性, 这表明机器人能够同时对双腿行走、腰部转动以及手臂操作进行协调, 而非像以往那般仅仅能够控制上半身, 于2026年7月30日的演示视频里, 机器人穿过房间, 弯腰拿起洒水壶, 随后再放置到架子上, 整个进程流畅连贯, 避开了地面上的障碍物。这已经不是简单的动作拼接,而是全身动作的有机统一。
从看懂到做到的推理能力
Gemini Robotics 2已非单纯执行预设指令的机器, 它拥有推理能力, 能对自然语言指令予以理解, 并把它分解成多步骤行动计划, 像你告知它“把桌子收拾干净”, 它会自行甄别哪些物品该放回原处、哪些该扔至垃圾桶, 接着规划出行走路线以及抓取顺序, 此套系统将摄像头所捕捉的画面与语言指令径直转化为电机控制指令, 越过了传统机器人需人工进行动作代码编写的繁杂流程。这次, 是以谷歌在2025年推出的Gemini Robotics作为基础,重点强化了全身协调能力, 重点强化了复杂任务规划能力。
三款模型各司其职
这一回, 谷歌一下子发布了三款机器人AI模型, 它们中的每一款, 不仅能够自行运作开展工作, 同时, 还能够彼此协作共同配合。Gemini Robotics 2承担把视觉以及语言信息转变成具体的电机控制指令的职责, 这一职责类似于机器人的“小脑”所发挥的功能;Gemini ER 2担当着“大脑”的角色, 此项角色负责规划多步骤任务, 并且协调多个机器人一起去达成同一个目标。另外, 存在一款On- Robotics 2模型, 它着重聚焦于更为精细难办的操作任务。这样的分工安排令开发者能够依据实际所需灵活进行挑选, 并非要为每一个场景均配置一整套系统。谷歌打算借由其AI开发者平台去开放这些模型, 当下已然朝着100多家获得信任的测试机构开放了早期的访问权限。
灵巧性提升但仍有短板
于灵巧性测试期间, Gemini Robotics 2展现出了明显的进步, 研究人员所公布的数据表明, 该系统达成“拧下灯泡”此项任务的成功率达到了92%, 这般的成绩是颇为夺目的。可在更为繁杂的操作方面, 像扎垃圾袋、封好密封袋这类需精细力度把控的任务, 成功率依旧是偏低的。这表明机器人于处理柔软、易变形物体之际, 距离人类的水平仍相差甚远。谷歌机器人业务总监Rao亦认可了, 直至目前, 机器人的动作尚依旧展现出迟缓且慎重的态势, 只因机器于开展执行的进程当中仍然需要停顿下来去思索那些人类借助直觉便能够达成的决策。距离切实的“类人灵巧”状态, 还有相当漫长的路程要前往。
安全机制成为重点
机器人愈发频繁地进入人类生活空间, 致使安全问题变得极为关键, 谷歌此次推出了一套全新的机器人安全评测基准, 专门用于测试机器人能不能识别不确定状况, 并且拒绝执行存有安全风险的指令, Gemini ER 2被谷歌称作迄今天下最安全的机器人模型, 特别是在遵循指令以及避让人类方面展现得更为出色, 这套安全机制的设计思路为: 当机器人碰到模糊指令或者可能引发危险的场景时, 主动停下操作并请求人类予以确认, 而非盲目去执行。这种围绕“谨慎优先”所采用的策略, 对于机器人迈入家庭, 在医院这种地方而言, 进入复杂环境是至关重要的。
巨头竞逐物理世界入口
谷歌此次发布, 並非独自发生之事, 而是整个科技行业于机器人AI上布局的一种表现。英伟达提供助力开发者训练AI机器人的软件平台, 且也在探寻将视觉、语言以及动作能力相融合, 构建通用机器人基础模型。谷歌有关机器人的战略, 实则是有过曲折的, 曾收购了多家机器人初创公司, 不过之后却逐渐削减相关业务, 还在2023年关闭了部门。此次再度发力, 意味着谷歌决定在“AI + 物理世界”的赛道里再次占据位置。谷歌机器人业务副总裁宣称, 我们的目的是把AI引入到物理世界之中, 并且搭建一层能够供所有机器人运用的智能系统。当下, 谷歌正在跟包含Agile SE以及在内的一系列核心合作伙伴开展合作,促使机器人AI的商业化实现落地。
未来五年之内, 你认为人形机器人能够走入普通家庭这件事可行吗? 欢迎在评论区域分享你针对此的看法, 要是觉得相关文章具备有用性, 那么一定不要忘记点赞并且转发给身边聚焦科技领域的友人。