Google a présenté Gemini Robotics ER 2, qui marque une étape majeure dans l'alimentation des robots par la compréhension vidéo, l'orchestration de tâches et la collaboration multi-robots, permettant ainsi aux machines d'être plus utiles dans le monde physique. Pour que les robots puissent assister les humains dans des environnements quotidiens, un raisonnement spatial précis ne suffit pas.
Les robots doivent également réfléchir rapidement, en synchronisant leurs décisions et leur raisonnement avec la vitesse en temps réel du monde physique. C'est pourquoi nous lançons aujourd'hui Gemini Robotics ER 2, notre modèle de " raisonnement incarné » (embodied reasoning) le plus performant pour la robotique.
Considérez Gemini Robotics ER 2 comme un cerveau de haut niveau pour les robots. Il leur permet d'interagir avec les humains, de comprendre le monde physique et de planifier des tâches multi-étapes. Il confie ensuite l'exécution motrice à n'importe quel modèle de bas niveau de type Vision-Langage-Action (VLA).
Gemini Robotics ER 2 peut également solliciter nativement des outils tels que Google Search pour trouver des informations, ou toute autre fonction définie par l'utilisateur. La conception de Gemini Robotics ER 2 permet au robot de " réfléchir » à l'étape suivante tout en exécutant simultanément ses actions.
Gemini Robotics ER 2 représente une mise à jour significative par rapport à Gemini Robotics ER 1.6. En analysant des flux vidéo continus, les robots peuvent désormais suivre leur propre progression, s'adapter en cas de problème et savoir exactement quand passer à l'étape suivante. Nous introduisons également la collaboration multi-robots, permettant aux machines de travailler ensemble dans des espaces partagés et de réaliser des flux de travail complexes qu'un seul robot ne pourrait accomplir seul. Gemini Robotics ER 2 est désormais accessible aux développeurs via l'API Gemini, Google AI Studio, et en version d'essai privée sur la Gemini Enterprise Agent Platform.
Pour vous aider à démarrer, nous partageons des exemples de configuration du modèle et de formulation de requêtes (prompting) pour piloter des tâches d'IA physique plus utiles. Faire progresser les capacités des agents physiques : la plupart des tâches dans le monde physique sont complexes et nécessitent plusieurs étapes. Gemini Robotics ER 2 agit comme un agent physique, orchestrant les étapes pour le robot et lui permettant de s'autocorriger et de se généraliser à des situations inédites.
Pour mettre en place un système d'agent, les développeurs peuvent déclarer des interfaces de contrôle de bas niveau — comme des modèles Vision-Langage-Action (VLA) ou des API de navigation — en tant qu'outils, et diffuser des flux multimodaux vidéo, audio ou textuels directement dans le modèle.
Gemini Robotics ER 2 améliore ce flux d'orchestration d'outils. Nous pouvons évaluer ses performances avec des robots en simulation, en utilisant un contrôle robotique en conditions réelles, et même le coupler à un humain contrôlant le robot à distance. En robotique, le raisonnement de haut niveau dépend de la vitesse d'exécution.
Gemini Robotics ER 2 s'intègre à l'API Gemini Live, utilisant un point de terminaison de streaming bidirectionnel optimisé pour les tâches sensibles à la latence. Le résultat est une orchestration fluide : Gemini Robotics ER 2 commande les modèles d'action et les API robotiques pour achever des tâches complexes sans les pauses saccadées de type " arrêt pour réflexion ».
Pour illustrer cela, nous avons conçu une démonstration avec Spot, de notre partenaire Boston Dynamics. Nous utilisons Gemini Robotics ER 2 pour orchestrer les API de Spot, telles que la navigation et le mouvement du manipulateur, créant ainsi un robot interactif capable d'aller chercher des objets pour vous. Le code est disponible sur Github avec d'autres exemples.
Libérer l'intelligence temporelle pour une exécution robuste des tâches : l'un des défis les plus ardus de la robotique est de savoir quand une tâche est terminée. Gemini Robotics ER 2 apporte une avancée majeure dans la compréhension vidéo et le suivi de progression pour vérifier que des tâches complexes —
telles que visser une ampoule ou fermer un sac poubelle — sont achevées selon les spécifications avant de passer à la suivante. Dans cette mise à jour, nous avons progressé sur deux capacités fondamentales pour la compréhension de l'avancement des tâches : la classification de la progression et le repérage de moments précis.
Classification continue de la progression : la classification de la progression désigne la capacité d'un robot à suivre l'avancement vers l'achèvement d'une tâche. Dans nos évaluations, nous classons chaque image d'un flux vidéo selon cinq niveaux de progression (0-20 %, 20-40 %, 40-60 %, 60-80 %, 80-100 %). En quantifiant l'avancement, Gemini Robotics ER 2 offre aux robots une conscience situationnelle en temps réel, leur permettant d'ajuster leurs actions à la volée ou de réessayer des étapes échouées sans redémarrer tout le processus.
Repérage de moments de précision : le repérage de moments mesure la capacité d'un modèle à identifier l'image vidéo exacte où un événement critique se produit (par exemple, quand arrêter de verser du café dans une tasse). Gemini Robotics ER 2 réalise des gains de performance significatifs dans ce domaine, permettant aux robots de basculer précisément entre les tâches, de vérifier le succès et de suggérer des corrections. Collaboration multi-robots : aucun robot n'est adapté à toutes les tâches —
un robot mobile à roues excelle en intérieur, tandis qu'un robot humanoïde peut être plus performant sur un terrain accidenté. Gemini Robotics ER 2 permet la collaboration multi-robots, autorisant différentes machines à communiquer via une compréhension sémantique partagée pour se passer le relais et accomplir des tâches complexes. Découvrez ici comment Gemini Robotics ER 2 permet à l'Apollo 2 d'Apptronik et au Franka F3 Duo de collaborer.
Amélioration de l'intelligence spatiale générale : Gemini Robotics ER 2 fait progresser nos capacités de raisonnement spatial de base, mesurées par trois référentiels (benchmarks) : Détection de succès/échec : fonctionne désormais sur des flux vidéo bruts plutôt que sur des clichés statiques pour détecter les erreurs en cours d'exécution, comme des déversements, des glissements ou des mauvais alignements. Lecture générale d'instruments : s'étend au-delà des cadrans circulaires et des voyants pour inclure les affichages numériques, les échelles linéaires, les règles et les thermomètres à liquide. Nous l'avons testé sur 10 types d'instruments différents.
VQA (Visual Question Answering) spatiale améliorée : améliore les réponses aux questions visuelles grâce aux avancées de Gemini dans la compréhension multimodale. Renforcement de la sécurité pour l'intelligence incarnée : Gemini Robotics ER 2 est notre modèle le plus sûr, affichant des gains importants sur les benchmarks de respect des instructions de sécurité et de proximité humaine, qui évaluent la manière dont un modèle respecte les contraintes physiques lors des tâches de raisonnement et sa conscience spatiale pour détecter les humains. Nous avons constaté que Gemini Robotics ER 2 immobilise avec succès un robot humanoïde lorsqu'une personne est à proximité et ne reprend le travail de manière autonome qu'une fois la zone dégagée.
Pour accroître la sécurité des agents physiques, nous introduisons un benchmark qui évalue la capacité d'un modèle de base à agir comme un orchestrateur VLA sûr en testant son aptitude à appliquer des contraintes de sécurité, à surveiller l'environnement, à évaluer la faisabilité physique et à solliciter des clarifications auprès d'un humain. Pour plus de détails, consultez notre rapport technique sur la sécurité. À l'avenir, nous prévoyons d'orienter ces modèles vers des tâches encore plus complexes afin d'accélérer le développement de robots utiles et de soutenir la communauté robotique.



















