Google DeepMind lanza Gemini Robotics 2: control de cuerpo completo y destreza de cinco dedos para humanoides
Google DeepMind presentó un paquete de tres modelos —Gemini Robotics 2, ER 2 y On-Device 2— que lleva a los robots más allá de la manipulación de mesa hacia el movimiento de cuerpo completo y el trabajo en equipo entre robots.
Google DeepMind lanzó Gemini Robotics 2 el 30 de julio, un paquete de tres modelos que lleva su plataforma de robótica más allá de tareas de mesa tipo “tomar y colocar” hacia el control de cuerpo completo en humanoides. La alineación: Gemini Robotics 2, un modelo de visión-lenguaje-acción (VLA) que convierte entrada visual y de lenguaje directamente en comandos motores; Gemini Robotics ER 2, un modelo de razonamiento corporeizado para planificación multi-paso y coordinación entre varios robots; y Gemini Robotics On-Device 2, un VLA compacto que corre localmente y se adapta a un cuerpo de robot nuevo con solo unas horas de datos.
La capacidad destacada es el control de cuerpo completo —caminar, agacharse y estirarse en un solo movimiento coordinado— junto con destreza de cinco dedos que permite a un humanoide tomar objetos irregulares que las pinzas de dos dedos anteriores no podían manejar. ER 2 añade la capa de planificación: puede descomponer una tarea en pasos, comunicar su intención a un colaborador humano y repartir subtareas entre varios robots que trabajan en el mismo espacio físico.
Google alineó socios de hardware para mostrar el alcance: el humanoide Apollo 2 de Apptronik, la plataforma de doble brazo Duo de Franka, Boston Dynamics y Agile Robots. Es una señal deliberada de que Gemini Robotics está pensado para ser agnóstico a la forma física del robot —la misma capa de razonamiento controlando un humanoide de almacén y un brazo de línea de producción.
El acceso es escalonado. ER 2 ya está disponible en Google AI Studio y en vista previa privada en la Gemini Enterprise Agent Platform —la vía de entrada más sencilla para desarrolladores que quieran prototipar planificación y razonamiento sin tocar un robot físico. Los modelos VLA completo y On-Device permanecen restringidos a un programa de acceso anticipado para socios, práctica habitual para cualquier sistema que emite comandos de torque motor a hardware real.
DeepMind también introdujo ASIMOV-Agentic, un nuevo benchmark de seguridad específicamente para verificar el comportamiento agéntico en robots físicos —una admisión tácita de que un modelo que elige sus propias acciones físicas de varios pasos necesita un estándar distinto al de uno que solo genera texto. El momento no es casual: llega la misma semana en que más de mil empleados de laboratorios de IA, incluidos varios de DeepMind, firmaron una carta pidiendo a los gobiernos construir herramientas para pausar el avance de la IA de frontera antes de que la autonomía supere la supervisión.
En lo competitivo, Google presiona una ventaja. Figure, 1X y el programa Optimus de Tesla compiten por humanoides de propósito general, pero lo difícil nunca fue caminar —es coordinar percepción, razonamiento y motricidad fina en un solo ciclo lo bastante rápido para ser útil. Lanzar ER 2 ampliamente mientras mantiene el VLA restringido permite a Google recolectar datos reales de despliegue con socios antes de abrir al público la capa más riesgosa.
Fuentes
Lecturas relacionadas
- Hardware NVIDIA Halos para Robótica: El Primer Sistema Completo de Seguridad para IA Física
- Infraestructura de IA Google DeepMind amplía su apuesta en robótica con la alianza con Agile Robots
- Modelos de IA Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y un modelo de ciberseguridad — sigue sin haber 3.5 Pro