Texte

GoogleÉtats-Unis

Gemini Robotics Er 2 Streaming

Le modèle d'Embodied Reasoning de Google, conçu pour orchestrer des flottes de robots via une API de streaming bidirectionnelle.

Dernière version
Gemini Robotics ER 2
Numéro de version
2
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Le 30 juillet 2026, Google a franchi une étape clé dans le domaine de la robotique cognitive avec le lancement en préversion publique de Gemini Robotics ER 2. Accessible via l'API Gemini et Google AI Studio, cette nouvelle famille de modèles introduit un point d'accès en temps réel particulièrement attendu : gemini-robotics-er-2-streaming-preview. Conçu spécifiquement pour la Live API, ce modèle succède à Gemini Robotics ER 1.6, dont l'arrêt définitif est programmé pour la fin du mois d'août 2026.

L'Embodied Reasoning : Un cerveau plutôt qu'un moteur

La particularité de la famille ER (Embodied Reasoning) réside dans son positionnement architectural. Contrairement aux modèles de type Vision-Langage-Action (VLA), qui génèrent directement des commandes motrices bas niveau pour les actionneurs d'un robot, Gemini Robotics ER 2 se comporte comme un planificateur de haut niveau.

Il agit comme le centre décisionnel et d'orchestration du robot. Face à une scène complexe et à une instruction humaine, le modèle analyse l'environnement, décompose les tâches de longue durée en étapes logiques et coordonne l'exécution en faisant appel à des outils externes. Il peut ainsi solliciter des API de navigation, des algorithmes de préhension, un modèle VLA tiers pour l'action physique, un service de synthèse vocale (TTS) ou encore effectuer des recherches via Google Search pour résoudre des ambiguïtés. De plus, ER 2 est capable de piloter et de synchroniser des robots distincts en maintenant un état de tâche partagé et collaboratif.

Modalités et architecture de streaming

L'identifiant gemini-robotics-er-2-streaming-preview s'appuie sur une connexion WebSocket (WSS) bidirectionnelle et persistante pour permettre une interaction à faible latence.

Le modèle accepte des entrées multimodales riches : Texte pour les instructions ; Audio sous forme de flux PCM 16 bits à 16 kHz ; * Vidéo transmise sous la forme d'images JPEG séquentielles, avec une limite documentée d'une image par seconde (1 fps).

En sortie, le modèle génère exclusivement du texte et des appels de fonctions (tool calling). Il ne produit nativement ni flux audio, ni images, ni vidéos. Pour qu'un robot puisse s'exprimer vocalement, les développeurs doivent configurer un appel de fonction redirigeant la sortie textuelle du modèle vers un moteur de synthèse vocale (TTS) externe.

Sur le plan technique, Gemini Robotics ER 2 est fondé sur le modèle Gemini 3.5 Flash. Selon sa carte de modèle officielle, il affiche une fenêtre de contexte allant jusqu'à 128 000 tokens et prend en charge des sorties textuelles maximales de 64 000 tokens. Toutefois, la documentation de l'API de streaming ne spécifiant pas de limites distinctes, il convient de rester prudent quant à la garantie de générer des réponses individuelles de 64 000 tokens lors d'une session Live active.

Performances et positionnement concurrentiel

Google met en avant les capacités d'analyse vidéo temporelle de son modèle, publiant des résultats précis : 57,4 % d'exactitude en classification de progression (évaluation de l'état d'avancement d'une tâche sur cinq segments vidéo distincts) ; 91,3 % d'exactitude en moment finding (détection de l'instant exact où survient un événement critique), avec une distance absolue moyenne de seulement 0,96 seconde.

Le constructeur affirme qu'ER 2 surpasse largement la version 1.6 en matière d'orchestration d'outils, de compréhension spatiale et de gestion de la sécurité, tout en devançant les modèles frontières concurrents. Ces affirmations de supériorité face à la concurrence doivent cependant être accueillies avec la retenue d'usage, les protocoles de test complets et les benchmarks indépendants n'étant pas détaillés dans l'annonce officielle.

Cas d'usage, limites et sécurité

Gemini Robotics ER 2 se destine en priorité aux scénarios industriels et logistiques complexes : Logistique (Pick-and-Pack) : Identification des objets, manipulation assistée par vérification visuelle et correction autonome des erreurs ; Surveillance continue : Analyse de flux vidéo en temps réel pour détecter des anomalies ou des changements d'état ; * Coordination multi-robots : Répartition des tâches au sein d'une flotte d'équipements.

Dans ces architectures, toute action physique doit impérativement être déclarée sous forme d'appels de fonctions bloquants : le modèle suspend son raisonnement et attend le retour d'état du matériel avant de formuler l'étape suivante.

Google rappelle également les limites intrinsèques liées aux grands modèles de langage, notamment la sensibilité aux variations de prompts, le risque d'hallucination et l'augmentation de la latence lors du traitement de volumes de données importants. Le modèle est strictement déconseillé pour les applications critiques de sécurité (santé, transports autonomes). Enfin, l'utilisation de flux contenant des données personnelles (visages, voix d'individus identifiables) exige des développeurs le respect des obligations d'information, de consentement et de minimisation des données.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Gemini Robotics ER 2

    Dernière version

    google:gemini-robotics-er-2-streaming-preview

    Outils
    Modèle de base
    Gemini 3.5 Flash
    Fenêtre de contexte
    128 000 tokens
    Sortie maximale
    64 000 tokens
    Protocole de streaming
    WebSocket (WSS) bidirectionnel
    Fréquence vidéo max
    1 image par seconde (JPEG)
    Format audio d'entrée
    PCM 16 bits à 16 kHz

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca