Texte

GoogleÉtats-Unis

Gemini Robotics Er 2

Le modèle de Google DeepMind conçu pour orchestrer les robots grâce à une analyse vidéo et spatiale avancée.

Dernière version
gemini-robotics-er-2-preview
Numéro de version
2
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Le 30 juillet 2026, Google a franchi une étape majeure dans le domaine de la robotique intelligente en lançant Gemini Robotics ER 2 (disponible en version « preview »). L'acronyme « ER » signifie « Embodied Reasoning » (raisonnement incarné). Ce modèle vision-langage de pointe a été conçu pour servir de couche de raisonnement et d'orchestration de haut niveau pour les systèmes robotiques. Contrairement aux modèles de contrôle moteur direct, ER 2 délègue l'exécution physique à des modèles de type vision-langage-action (VLA) ou à des API robotiques de bas niveau.

Fondé sur l'architecture de Gemini 3.5 Flash, Gemini Robotics ER 2 a été enrichi par Google DeepMind avec des données d'entraînement supplémentaires spécifiquement dédiées au raisonnement incarné. Il succède à Gemini Robotics ER 1.6, dont Google recommande d'ailleurs la migration.

Une architecture multimodale au service de l'action

Le point d'entrée standard de Gemini Robotics ER 2 se distingue par sa grande flexibilité multimodale. Il accepte des entrées de nature diverse (texte, image, vidéo et audio), y compris de manière intercalée. En revanche, sa sortie est exclusivement textuelle. Le modèle ne génère ni images ni flux audio, mais produit des données structurées hautement exploitables par des machines, telles que du code JSON, des coordonnées spatiales, des boîtes englobantes, des plans d'action ou des appels d'outils.

Ses capacités se concentrent sur l'intelligence spatiale et temporelle. Le modèle excelle dans : - La désignation et la détection d'objets ; - Le suivi vidéo et l'estimation de trajectoires ; - La lecture d'instruments de mesure ; - Le raisonnement sur les relations spatiales ; - La planification d'actions multi-étapes.

Pour mener à bien ces tâches complexes, ER 2 intègre des fonctionnalités avancées telles que le raisonnement (« thinking »), l'exécution de code, les appels de fonctions, la génération de sorties structurées, ainsi que l'accès à Google Search, Google Maps, File Search et au contexte d'URL.

L'analyse de progression vidéo : la clé de voûte de l'orchestration

L'innovation la plus marquante de Gemini Robotics ER 2 réside dans sa capacité d'analyse de la progression vidéo. Le modèle est capable d'identifier le moment précis où un événement survient (fonctionnalité de « moment finding ») et de classifier la progression d'une tâche selon cinq paliers distincts (de 0–20 % à 80–100 %).

Google recommande d'utiliser ces fonctions pour vérifier la réussite d'une tâche, détecter un échec en cours d'exécution et déclencher immédiatement des actions de correction. Grâce à une boucle d'appels de fonctions, ER 2 peut orchestrer plusieurs robots ou outils en simultané. Un exemple officiel montre ainsi le modèle pilotant les primitives de déplacement et de pince d'un bras robotisé pour réaliser une tâche classique de « pick-and-place » (saisie et dépôt d'objets).

Performances mesurées et positionnement

Google revendique une amélioration systématique des performances d'ER 2 par rapport à la version ER 1.6 en matière d'orchestration d'outils. Ces progrès ont été évalués selon trois modalités de contrôle : sur un modèle VLA réel, en simulation, et lors de sessions de téléopération humaine.

Dans le détail, les chiffres clés annoncés par le constructeur sont les suivants : - Précision de l'analyse de progression : 57,4 % ; - Précision du « moment finding » : 91,3 %, avec une erreur absolue moyenne limitée à 0,96 seconde.

Google affirme également que le modèle s'exécute quatre fois plus vite que des catégories de modèles plus volumineuses. Bien que le fournisseur évoque des résultats supérieurs à ER 1.6 et à des « modèles de pointe concurrents » sur la détection de succès/échec, la lecture d'instruments ou la VQA (Visual Question Answering) spatiale, aucune donnée comparative chiffrée ou nom de concurrent n'a été fourni dans les publications officielles. Une comparaison indépendante reste donc à établir.

Limites techniques et impératifs de sécurité

Comme tout modèle d'intelligence artificielle, Gemini Robotics ER 2 présente des limites que les développeurs doivent prendre en compte. Google mentionne explicitement le risque d'hallucinations, la forte dépendance à la qualité des prompts, l'augmentation de la latence lors du traitement d'entrées en haute résolution ou de requêtes exigeant un haut niveau de raisonnement, ainsi que le coût lié au traitement des flux vidéo.

Pour atténuer ces risques, il est conseillé de segmenter les tâches complexes, d'optimiser les conditions de prise de vue (cadrage, éclairage, contraste) et de répéter les requêtes pour les décisions spatiales nécessitant une haute précision.

Sur le plan de la sécurité, Google insiste sur le fait que le modèle ne doit en aucun cas être déployé dans des contextes critiques où une défaillance pourrait causer des blessures, des décès ou des dommages matériels majeurs (notamment dans les secteurs de la santé ou des transports). Les déploiements physiques doivent impérativement intégrer des garde-fous matériels indépendants, une validation applicative rigoureuse et respecter le consentement des personnes susceptibles d'être filmées ou enregistrées.

Une fois activé, les tarifs applicables sur notre plateforme pour ce modèle seront de 30,00 $ par million de tokens en entrée et de 50,00 $ par million de tokens en sortie. À titre de comparaison, les tarifs publics de l'API Gemini Developer s'élèvent à 2,00 $/million de tokens d'entrée et 10,00 $/million de tokens de sortie (incluant les tokens de raisonnement). Pour les besoins de streaming bidirectionnel à faible latence, Google propose également un endpoint distinct nommé gemini-robotics-er-2-streaming-preview.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Gemini Robotics ER 2

    Dernière version

    google:gemini-robotics-er-2-preview

    Outils
    Fenêtre de contexte
    128 000 tokens
    Limite de tokens de sortie
    65 536 tokens
    Modèle de base
    Gemini 3.5 Flash
    Précision Moment Finding
    91,3 %
    Tarif d'entrée plateforme
    30,00 $ / million de tokens
    Tarif de sortie plateforme
    50,00 $ / million de tokens

    Tarif annoncé : 2.00 $ en entrée, 10.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca