Gemini Robotics 2: control de cuerpo completo

Actualizado el 31/07/2026: Google DeepMind detalló Gemini Robotics ER 2, el modelo de razonamiento encarnado que ahora supervisa el video del robot en tiempo real para corregir sobre la marcha y coordinar varios robots. Es la evolución directa de ER 1.6 y ya está en Google AI Studio y la Gemini API.

En pocas palabras: Google DeepMind lanzó Gemini Robotics 2 el 30 de julio de 2026: un modelo que le da a los robots control de todo el cuerpo, destreza con manos de cinco dedos y coordinación entre robots. Se apoya en tres modelos —VLA, ER 2 y una versión On-Device— para tareas largas.

Google DeepMind presentó Gemini Robotics 2 el 30 de julio de 2026, un modelo de IA que le da a los robots control inteligente de todo el cuerpo, destreza fina con cinco dedos y la capacidad de coordinarse con otros robots para resolver tareas largas que antes ni se intentaban. En criollo: el robot ya no mueve solo los brazos, ahora piensa el movimiento entero.

Gemini Robotics 2 es la capa de inteligencia de Google DeepMind para robots, construida sobre tres modelos: el VLA (Visión, Lenguaje y Acción), que convierte lo que el robot ve en movimientos concretos; el ER 2 (razonamiento encarnado), que planifica secuencias largas de decisiones; y una versión On-Device que corre en el propio robot sin depender de la nube. Juntos habilitan el control de cuerpo completo.

En 30 segundos

  • Qué es: la segunda generación del modelo de IA de Google DeepMind para robots, anunciada el 30 de julio de 2026.
  • Lo nuevo: control de cuerpo completo (de los pies a los dedos), destreza con manos de cinco dedos, y trabajo en equipo entre robots distintos.
  • El cerebro: Gemini Robotics ER 2 ahora monitorea el video del robot en vivo, se adapta a los problemas sobre la marcha y decide cuándo pasar al próximo paso.
  • Acceso: ER 2 ya está disponible en Google AI Studio y la Gemini API; el VLA y el On-Device siguen en programa de acceso restringido (Trusted Tester).

Gemini es un modelo de IA multimodal desarrollado por Google que puede procesar y generar texto, imágenes, audio y vídeo. Fue presentado en diciembre de 2023 y está disponible en diferentes versiones (Nano, Pro, Ultra).

¿Qué es Gemini Robotics 2 y cómo se organiza?

Gemini Robotics 2 es un modelo VLA (Visión, Lenguaje y Acción) que le da a un robot la capacidad de razonar cada movimiento en vez de ejecutar una secuencia pre-programada. Según el anuncio oficial de DeepMind, la novedad es que trata al cuerpo entero como un sistema único.

Se divide en tres piezas. El VLA es el que actúa: mira, entiende la orden en lenguaje natural y genera el movimiento. El ER 2 (Embodied Reasoning) es el cerebro que planifica, y ya está abierto para desarrolladores. El tercero, On-Device, corre local en el robot, sin latencia de red.

La diferencia gruesa con la generación anterior: antes cada habilidad era casi un sistema aparte. Ahora hay una sola política que coordina locomoción y manipulación al mismo tiempo. Eso, que suena a detalle, es medio que todo el juego.

¿Qué significa el control de cuerpo completo?

El control de cuerpo completo (whole-body intelligence) es que el robot coordina piernas, torso y brazos como una sola unidad para completar una tarea. Un humanoide puede caminar, agacharse, estirarse y manipular un objeto sin que esas acciones vivan en módulos separados que después hay que pegar con cinta. Consultá nuestra guía completa sobre Gemini.

Acá viene lo bueno: la generación anterior controlaba sobre todo la parte de arriba, los brazos. Si el objeto estaba en el piso, el robot no sabía bien qué hacer con el resto del cuerpo. Con Gemini Robotics 2, DeepMind muestra al robot Apollo levantando cosas desde el suelo, desde una mesa y desde un estante alto. Lo explicamos a fondo en si querés dominar Gemini desde cero.

Los resultados que reporta la empresa marcan justo esa brecha por altura. Ponele que le pedís que junte objetos de distintas superficies: le va mejor con las que están a la altura de una mesa o un estante, y peor con las del piso. Traducido: agacharse y trabajar cerca del suelo sigue siendo lo más difícil (algo que cualquiera con dolor de espalda entiende perfecto).

¿Qué destreza tienen las manos de Gemini Robotics 2?

Gemini Robotics 2 maneja manos de cinco dedos con destreza fina, lo que le permite tareas de precisión que antes eran imposibles para un robot de propósito general. Hablamos de movimientos finos, no de agarrar y soltar cajas.

Los grados de libertad son, en la práctica, la cantidad de articulaciones independientes que la mano puede mover. Cuantos más tiene, mejor puede coordinar los dedos para gestos que requieren fuerza y delicadeza a la vez. El salto respecto de las pinzas de dos dedos de sistemas anteriores es enorme.

¿Qué tareas concretas demostró DeepMind?

DeepMind mostró a los robots resolviendo tareas cotidianas que exigen varios pasos encadenados: por ejemplo, limpiar una habitación desordenada o poner una regadera en su lugar. Parecen tonterías, pero cada una combina percepción, planificación y motricidad fina en secuencia. Más contexto en usando Gemini en Chrome.

¿Por qué importan tareas tan domésticas? Porque son el tipo de trabajo desestructurado que rompe a los robots industriales clásicos. Ordenar un cuarto lleno de objetos sueltos exige alinear con precisión, manipular material que cambia de forma y controlar la fuerza para no pasarse. Todo eso, encadenado y sobre la marcha.

El contexto donde esto pega fuerte: manufactura, logística y tareas del hogar. Un robot que arma un pedido en un depósito o que ordena un cuarto lleno de objetos sueltos necesita exactamente esta clase de adaptación al desorden real.

¿Cómo colaboran varios robots entre sí?

Con Gemini Robotics 2, robots de distinto tipo se comunican y se reparten el trabajo para completar una tarea más rápido, o para resolver algo que un solo robot no podría. En la demo, un humanoide limpia una habitación desordenada y suma a otro robot para cerrar el trabajo más rápido. Ya lo cubrimos antes en directamente en tu navegador Chrome.

El tema es que esto abre flujos que antes no cerraban. Uno sostiene, otro manipula. Uno transporta, otro clasifica. La coordinación entre cuerpos distintos siempre fue el cuello de botella, porque transferir una habilidad de un robot a otro era un dolor de cabeza. Este modelo apunta justo ahí.

¿Cómo se accede a Gemini Robotics 2?

Hay tres niveles de acceso, y no todos están abiertos. El ER 2 (el modelo de razonamiento) ya está disponible desde hoy en Google AI Studio y la Gemini API. El VLA y el On-Device siguen detrás del programa Trusted Tester, o sea acceso restringido para socios seleccionados.

  • ER 2 (razonamiento): abierto en Google AI Studio y la Gemini API. Sirve para planificar tareas de horizonte largo, con cientos de decisiones encadenadas.
  • VLA (acción): el que ejecuta el movimiento. Requiere entrar al programa Trusted Tester.
  • On-Device: corre local en el robot, pensado para eficiencia y baja latencia sin nube. También bajo acceso restringido.

Ojo con esto: que ER 2 esté en la API no significa que puedas comprar un robot que hace todo. Es la capa de software, y la mayoría del stack todavía está cerrado. Esto se conecta con lo que analizamos en integrando Gemini en tus proyectos.

¿Qué es Gemini Robotics ER 2 y en qué mejora respecto a ER 1.6?

Gemini Robotics ER 2 es el modelo de razonamiento encarnado (embodied reasoning) que funciona como cerebro de alto nivel del robot: entiende el espacio físico, arma planes de varios pasos y le delega la ejecución motriz a los modelos VLA. Es la evolución directa de ER 1.6, y su salto grande es que ahora supervisa lo que hace mientras lo hace.

La diferencia concreta con ER 1.6: la versión anterior planificaba, pero no vigilaba la ejecución en vivo. ER 2 suma monitoreo continuo de la señal de video para que el robot detecte si algo salió mal, se reacomode y sepa cuándo un paso terminó y arranca el siguiente. En criollo, dejó de ser un planificador ciego para volverse uno que mira todo el tiempo.

DeepMind respalda esa mejora con benchmarks propios. Según el anuncio oficial de Google, gracias a la monitorización continua de la señal de video ER 2 supervisa mejor su propio progreso, se adapta si surge un problema y sabe con precisión cuándo pasar al siguiente paso. La empresa dice que en éxito/fracaso marca su mejor precisión hasta la fecha, por encima de ER 1.6. Un dato que las fuentes oficiales no aclaran: sobre qué modelo Gemini base corre ER 2.

El anuncio lleva la firma de Steven Hansen (Senior Staff Software Engineer) y Peng Xu (Staff Software Engineer) de Google DeepMind, que también destacan la capacidad de coordinar varios robots con “entendimiento semántico compartido”. Habría que verlo fuera de las demos, pero la dirección es clara: el cerebro ahora corrige en caliente.

AspectoGemini Robotics ER 1.6Gemini Robotics ER 2
RolPlanificación de tareasPlanificación + supervisión en vivo
Video durante la ejecuciónNo monitorea en tiempo realMonitoreo continuo de la señal
Adaptación a erroresLimitadaSe reacomoda sobre la marcha
Detección de momentos claveMenor precisiónMayor precisión, sabe cuándo pasar al siguiente paso
Coordinación multi-robotAcotadaEntendimiento semántico compartido
gemini robotics er 2 diagrama explicativo

¿Cómo funciona el monitoreo de video en tiempo real de Gemini Robotics ER 2?

Gemini Robotics ER 2 recibe la señal de video del robot de forma continua y la usa para corregir mientras actúa, en lugar de mirar solo antes o después de moverse. Esa es la bisagra: la visión pasó de ser una foto puntual a un flujo que alimenta cada decisión.

Para lograrlo, DeepMind lo apoya en la API de Gemini Live, un punto final de transmisión bidireccional pensado para tareas sensibles a la latencia. La idea es que el robot no tenga que frenar a “parar y pensar” entre paso y paso. El propio anuncio habla de una “orquestación fluida”, donde el modelo decide en el momento si el paso actual terminó o si algo se torció y hay que rehacerlo. Más contexto en conectando Gemini a tus aplicaciones.

Hay un ángulo de seguridad que no es menor. DeepMind lo describe como su “modelo más seguro” hasta ahora, con mejor seguimiento de instrucciones de seguridad y sensibilidad a la proximidad humana: frena a los humanoides cuando detecta personas cerca. Tomalo con pinzas igual, porque son pruebas controladas; el comportamiento real en un depósito lleno de gente todavía está por verse.

Más allá de la API pública, ER 2 asoma también en la Gemini Enterprise Agent Platform, por ahora en una versión preliminar privada. O sea, hay una pata corporativa en preparación, pero no está abierta para cualquiera.

Qué está confirmado y qué todavía no está confirmado

Conviene separar lo que Google ya publicó de lo que quedó abierto. Esto es lo que sabemos con nombre y apellido, y lo que todavía no.

  • Confirmado — ER 2 está disponible: se puede probar hoy en Google AI Studio y en la Gemini API, con fecha de anuncio 30 de julio de 2026.
  • Confirmado — monitoreo en vivo: ER 2 supervisa el video de forma continua vía la API de Gemini Live y se adapta durante la ejecución.
  • Confirmado — benchmarks propios: mejor clasificación del progreso y detección de momentos clave que ER 1.6, según Google DeepMind.
  • Confirmado — enfoque en seguridad: Google lo llama su modelo más seguro, con frenado ante proximidad humana.
  • Sin confirmar — el modelo base: las fuentes oficiales no dicen sobre qué versión de Gemini se apoya ER 2.
  • Sin confirmar — la Enterprise Agent Platform: está en preview privada, sin fecha de disponibilidad general ni precio.
  • Sin confirmar — VLA y On-Device: siguen en Trusted Tester, sin apertura pública anunciada.
  • Sin confirmar — rendimiento fuera del laboratorio: los resultados vienen de pruebas de DeepMind, no de despliegues productivos.

¿Dónde se va a usar? Aplicaciones industriales

Las aplicaciones apuntan a manufactura, logística e inspección. DeepMind mostró el mismo modelo controlando distintas plataformas robóticas, sobre una variedad de tareas.

Lo interesante es hacia dónde escala. Depósitos donde el layout cambia todo el tiempo, hospitales y laboratorios con material delicado, líneas de armado con piezas que no siempre llegan bien orientadas. Son entornos donde el robot pre-programado clásico se traba y necesita, justo, capacidad de adaptación.

Gemini Robotics 1 vs Gemini Robotics 2: qué cambió

AspectoGemini Robotics (1ª gen)Gemini Robotics 2
Control del cuerpoSobre todo brazos y parte superiorCuerpo completo: locomoción + manipulación
ArquitecturaHabilidades en sistemas fragmentadosPolítica unificada que coordina todo
Duración de tareasSecuencias cortasTareas de minutos, con cientos de decisiones
ManosManipulación más limitadaCinco dedos con destreza fina
Multi-robotEnfoque en un robotCoordinación entre robots distintos
gemini robotics 2 diagrama explicativo

Errores comunes al leer este anuncio

  • Creer que ya se puede comprar: no es un producto de consumo. Gemini Robotics 2 es la capa de inteligencia, y el grueso (VLA y On-Device) está en acceso restringido. Lo abierto hoy es solo el ER 2 vía API.
  • Confundir los tres modelos: ER 2 razona y planifica, el VLA ejecuta el movimiento, On-Device corre local. Si probás ER 2 en la API, no estás moviendo un robot real, estás usando la parte de planificación.
  • Leer las demos como “funciona siempre”: que levante objetos de una mesa no quiere decir que acierte siempre, y cerca del piso le cuesta bastante más. Es progreso real, no un robot infalible.
  • Asumir transferencia gratis entre robots: pasar una habilidad de un cuerpo a otro sigue siendo difícil. El modelo mejora esto, pero no lo resuelve del todo.

Preguntas Frecuentes

¿Qué es Gemini Robotics ER 2?

Es el modelo de razonamiento encarnado de Google DeepMind que actúa como cerebro de alto nivel del robot: entiende el espacio, planifica tareas de varios pasos y delega la ejecución motriz a los modelos VLA. Se anunció el 30 de julio de 2026 y su novedad es que monitorea el video del robot en tiempo real para adaptarse mientras actúa. Complementá con cómo se compara con Claude.

¿En qué se diferencia Gemini Robotics ER 2 de ER 1.6?

ER 2 supervisa la señal de video de forma continua durante la ejecución, algo que ER 1.6 no hacía. Eso le permite detectar problemas, corregir sobre la marcha y saber cuándo un paso terminó. En los benchmarks de DeepMind mejora la detección de momentos clave y la clasificación de éxito/fracaso frente a ER 1.6.

¿Está disponible Gemini Robotics ER 2 para usar ahora?

Sí, ER 2 ya se puede probar en Google AI Studio y en la Gemini API desde el 30 de julio de 2026. También hay una versión preliminar privada en la Gemini Enterprise Agent Platform, sin fecha de disponibilidad general. Los modelos VLA y On-Device siguen en acceso restringido (Trusted Tester).

¿Qué es la inteligencia de cuerpo completo?

Es que el robot coordina piernas, torso y brazos como un solo sistema para completar una tarea, en vez de manejar cada parte por separado. Le permite caminar, agacharse, estirarse y manipular objetos de forma continua, incluso trabajando a nivel del piso o en estantes altos.

¿Sirve para robots que no son de Google?

Sí, la idea es que funcione en robots de distintas formas y fabricantes. DeepMind ya demostró el mismo modelo controlando distintas plataformas robóticas, sobre una variedad de tareas de cuerpo completo y manipulación.

Conclusión

Gemini Robotics 2 mueve la aguja en algo puntual: dejar de tratar al robot como un brazo con ruedas y empezar a manejarlo como un cuerpo entero que piensa el movimiento completo. Con el detalle de ER 2, ese cerebro ahora también mira lo que hace en vivo y se corrige, en vez de planificar a ciegas.

Eso sí: los propios resultados lo ponen en perspectiva. Que todavía le cueste trabajar a nivel del piso y clasificar el progreso de una tarea dice que falta bastante para el robot doméstico confiable. Y casi todo el stack sigue cerrado, así que por ahora es una herramienta para desarrolladores y socios industriales, no para tu casa.

Si trabajás en manufactura, logística o robótica, lo accionable es concreto: probá Gemini Robotics ER 2 en la Gemini API para entender cómo planifica y supervisa tareas largas, y seguí de cerca el programa Trusted Tester y la Enterprise Agent Platform si te interesa el control físico. El resto, habría que verlo funcionando fuera de las demos.

Fuentes

Desplazarse hacia arriba