Google DeepMind presentó Gemini Robotics 2, la nueva versión de su inteligencia artificial para robots físicos, que promete mayor destreza, capacidad de análisis en tiempo real y mecanismos de seguridad más robustos. El lanzamiento incluye tres modelos, aunque por ahora solo uno está disponible públicamente para desarrolladores.
El objetivo de Gemini Robotics es crear un robot generalista, capaz de realizar cualquier tarea que haría una persona. Los científicos de Google DeepMind se refieren a este concepto como "AGI física": un sistema al que se le indica qué hacer y lo ejecuta.
Google DeepMind presentó Gemini Robotics
Qué es Gemini Robotics ER 2 y qué mejoras trae
Gemini Robotics ER 2 es el modelo de "razonamiento incorporado" actualizado, que según DeepMind representa un salto significativo respecto de la versión anterior 1.6. Está integrado con la Gemini Live API, lo que permite a los desarrolladores probar sus nuevas capacidades.
Se trata de un modelo de visión y lenguaje (VLM) diseñado para entender instrucciones y el entorno. La principal mejora es que puede procesar video en vivo desde las cámaras del robot, lo que le permite hacer seguimiento del progreso de cada tarea paso a paso.
Clasifica la completitud de los fotogramas de video con casi 60% de precisión
Identifica momentos clave de una tarea con casi 90% de precisión
Permite detectar errores en tiempo real y corregir un solo paso, sin reiniciar toda la tarea
Por ejemplo, si una pelota que el robot intenta agarrar se aleja rodando, el sistema puede reajustar la posición y el movimiento de su mano sin volver a empezar desde cero.
Robots que colaboran entre sí
El nuevo modelo de razonamiento incorporado también le da a la IA de robótica de Google DeepMind la capacidad de coordinar tareas entre distintos robots. En las demostraciones, el Apollo 2 de Apptronik y el más simple Franka F3 Duo trabajaron juntos en una misma tarea sin interferir entre ellos.
Si bien los robots de prueba todavía no igualan la velocidad ni la fluidez de un humano, las demostraciones en video muestran un comportamiento con menos titubeos respecto de pruebas anteriores.
Robots que colaboran entre sí
Cómo funciona el modelo que ejecuta las acciones del robot
Una vez que el modelo de visión y lenguaje planifica la tarea, la ejecución queda a cargo de otro sistema: el modelo de visión-lenguaje-acción actualizado, llamado Gemini Robotics 2. Esta IA genera las acciones del robot a partir de las instrucciones, de forma similar a como otros sistemas generativos crean texto o imágenes.
También existe una versión de baja latencia para uso sin conexión, denominada Gemini Robotics On-Device 2. Ambos modelos están por ahora limitados a un grupo reducido de testeadores. Según Google, incluso la versión on-device puede adaptarse a nuevos diseños de robots con apenas unas horas de datos de movimiento, o alrededor de 200 ejemplos.
Los nuevos estándares de seguridad de Gemini Robotics 2
Con esta versión, Google DeepMind incorporó un nuevo benchmark de seguridad llamado ASIMOV-Agentic, que evalúa a los modelos en distintos factores de seguridad. La prueba analiza si un agente de razonamiento incorporado rechaza llamadas a herramientas inseguras, si una tarea puede completarse de forma segura y si el modelo puede pedir asistencia humana ante dudas de seguridad.
Los nuevos estándares de seguridad de Gemini Robotics 2
Según la compañía, Gemini Robotics ER 2 es el modelo más seguro desarrollado hasta el momento por el equipo, con una sólida capacidad para detener acciones cuando una persona se encuentra demasiado cerca del robot. El nuevo benchmark de seguridad está disponible en su totalidad en Hugging Face.