Ce que fait ce modèle
Le 30 juillet 2026, Google a franchi une étape majeure dans le domaine de la robotique intelligente en lançant Gemini Robotics ER 2 (disponible en version « preview »). L'acronyme « ER » signifie « Embodied Reasoning » (raisonnement incarné). Ce modèle vision-langage de pointe a été conçu pour servir de couche de raisonnement et d'orchestration de haut niveau pour les systèmes robotiques. Contrairement aux modèles de contrôle moteur direct, ER 2 délègue l'exécution physique à des modèles de type vision-langage-action (VLA) ou à des API robotiques de bas niveau.
Fondé sur l'architecture de Gemini 3.5 Flash, Gemini Robotics ER 2 a été enrichi par Google DeepMind avec des données d'entraînement supplémentaires spécifiquement dédiées au raisonnement incarné. Il succède à Gemini Robotics ER 1.6, dont Google recommande d'ailleurs la migration.
Une architecture multimodale au service de l'action
Le point d'entrée standard de Gemini Robotics ER 2 se distingue par sa grande flexibilité multimodale. Il accepte des entrées de nature diverse (texte, image, vidéo et audio), y compris de manière intercalée. En revanche, sa sortie est exclusivement textuelle. Le modèle ne génère ni images ni flux audio, mais produit des données structurées hautement exploitables par des machines, telles que du code JSON, des coordonnées spatiales, des boîtes englobantes, des plans d'action ou des appels d'outils.
Ses capacités se concentrent sur l'intelligence spatiale et temporelle. Le modèle excelle dans : - La désignation et la détection d'objets ; - Le suivi vidéo et l'estimation de trajectoires ; - La lecture d'instruments de mesure ; - Le raisonnement sur les relations spatiales ; - La planification d'actions multi-étapes.
Pour mener à bien ces tâches complexes, ER 2 intègre des fonctionnalités avancées telles que le raisonnement (« thinking »), l'exécution de code, les appels de fonctions, la génération de sorties structurées, ainsi que l'accès à Google Search, Google Maps, File Search et au contexte d'URL.
L'analyse de progression vidéo : la clé de voûte de l'orchestration
L'innovation la plus marquante de Gemini Robotics ER 2 réside dans sa capacité d'analyse de la progression vidéo. Le modèle est capable d'identifier le moment précis où un événement survient (fonctionnalité de « moment finding ») et de classifier la progression d'une tâche selon cinq paliers distincts (de 0–20 % à 80–100 %).
Google recommande d'utiliser ces fonctions pour vérifier la réussite d'une tâche, détecter un échec en cours d'exécution et déclencher immédiatement des actions de correction. Grâce à une boucle d'appels de fonctions, ER 2 peut orchestrer plusieurs robots ou outils en simultané. Un exemple officiel montre ainsi le modèle pilotant les primitives de déplacement et de pince d'un bras robotisé pour réaliser une tâche classique de « pick-and-place » (saisie et dépôt d'objets).
Performances mesurées et positionnement
Google revendique une amélioration systématique des performances d'ER 2 par rapport à la version ER 1.6 en matière d'orchestration d'outils. Ces progrès ont été évalués selon trois modalités de contrôle : sur un modèle VLA réel, en simulation, et lors de sessions de téléopération humaine.
Dans le détail, les chiffres clés annoncés par le constructeur sont les suivants : - Précision de l'analyse de progression : 57,4 % ; - Précision du « moment finding » : 91,3 %, avec une erreur absolue moyenne limitée à 0,96 seconde.
Google affirme également que le modèle s'exécute quatre fois plus vite que des catégories de modèles plus volumineuses. Bien que le fournisseur évoque des résultats supérieurs à ER 1.6 et à des « modèles de pointe concurrents » sur la détection de succès/échec, la lecture d'instruments ou la VQA (Visual Question Answering) spatiale, aucune donnée comparative chiffrée ou nom de concurrent n'a été fourni dans les publications officielles. Une comparaison indépendante reste donc à établir.
Limites techniques et impératifs de sécurité
Comme tout modèle d'intelligence artificielle, Gemini Robotics ER 2 présente des limites que les développeurs doivent prendre en compte. Google mentionne explicitement le risque d'hallucinations, la forte dépendance à la qualité des prompts, l'augmentation de la latence lors du traitement d'entrées en haute résolution ou de requêtes exigeant un haut niveau de raisonnement, ainsi que le coût lié au traitement des flux vidéo.
Pour atténuer ces risques, il est conseillé de segmenter les tâches complexes, d'optimiser les conditions de prise de vue (cadrage, éclairage, contraste) et de répéter les requêtes pour les décisions spatiales nécessitant une haute précision.
Sur le plan de la sécurité, Google insiste sur le fait que le modèle ne doit en aucun cas être déployé dans des contextes critiques où une défaillance pourrait causer des blessures, des décès ou des dommages matériels majeurs (notamment dans les secteurs de la santé ou des transports). Les déploiements physiques doivent impérativement intégrer des garde-fous matériels indépendants, une validation applicative rigoureuse et respecter le consentement des personnes susceptibles d'être filmées ou enregistrées.
Une fois activé, les tarifs applicables sur notre plateforme pour ce modèle seront de 30,00 $ par million de tokens en entrée et de 50,00 $ par million de tokens en sortie. À titre de comparaison, les tarifs publics de l'API Gemini Developer s'élèvent à 2,00 $/million de tokens d'entrée et 10,00 $/million de tokens de sortie (incluant les tokens de raisonnement). Pour les besoins de streaming bidirectionnel à faible latence, Google propose également un endpoint distinct nommé gemini-robotics-er-2-streaming-preview.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Texte
Type principal de contenu traité ou produit par ce modèle.
Outils
Peut appeler des outils ou des fonctions (recherche, calcul, actions).
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
Gemini Robotics ER 2
Dernière versiongoogle:gemini-robotics-er-2-previewOutils- Fenêtre de contexte
- 128 000 tokens
- Limite de tokens de sortie
- 65 536 tokens
- Modèle de base
- Gemini 3.5 Flash
- Précision Moment Finding
- 91,3 %
- Tarif d'entrée plateforme
- 30,00 $ / million de tokens
- Tarif de sortie plateforme
- 50,00 $ / million de tokens
Tarif annoncé : 2.00 $ en entrée, 10.00 $ en sortie, par million de jetons (USD)