Reconnaissance vocale

GoogleÉtats-Unis

Gemini Transcribe

L’identifiant gemini-3.5-transcribe et étude de Gemini 3.5 Flash, le modèle multimodal de référence de Google pour la transcription avancée.

Dernière version
Gemini 3.5 Transcribe Live
Numéro de version
3.5
Type
Reconnaissance vocale
Versions recensées
2

Ce que fait ce modèle

Un point de clarification sur l’appellation « gemini-3.5-transcribe »

Dans l'écosystème en constante évolution de l'intelligence artificielle, la nomenclature des modèles peut parfois prêter à confusion. Au 26 août 2026, aucune source officielle de Google ne répertorie de modèle sous l'identifiant exact de gemini-3.5-transcribe. Les répertoires officiels de l'API Gemini, notamment maintenus sur Google AI for Developers, mentionnent des déclinaisons telles que gemini-3.5-flash, gemini-3.5-flash-lite et gemini-3.5-live-translate-preview, mais ce modèle spécifique de transcription pure est absent des fiches techniques, des annonces de sortie et des grilles tarifaires.

Il convient donc de comprendre que l'appellation gemini-3.5-transcribe désigne très probablement, de manière informelle ou erronée, l'utilisation du modèle Gemini 3.5 Flash dans des scénarios de transcription. Ce dernier est un modèle intrinsèquement multimodal capable de recevoir des flux audio en entrée pour générer du texte, remplissant ainsi parfaitement le rôle d'un outil de reconnaissance vocale automatique (ASR) sans pour autant être segmenté sous une API ou un nom distinct.

Gemini 3.5 Flash : le véritable moteur de la transcription moderne

Le modèle officiellement documenté le plus proche et le plus apte à remplir ces tâches est Gemini 3.5 Flash (identifié sous le nom de gemini-3.5-flash). Sorti en version de disponibilité générale (GA) le 19 mai 2026, Google le présente comme sa déclinaison « Flash » la plus intelligente à cette date. Ce modèle a été spécifiquement conçu pour répondre aux exigences des exécutions agentiques, du développement de code et du traitement de tâches volumineuses à grande échelle.

Contrairement aux outils de transcription traditionnels qui se limitent à convertir la parole en texte brut, Gemini 3.5 Flash est une solution multimodale native. Sa fiche technique et sa Model Card publiée par Google DeepMind confirment qu'il prend en charge une grande diversité de formats en entrée : le texte, les images, la vidéo, les fichiers PDF et, bien entendu, l'audio. En sortie, le modèle produit exclusivement du texte. Cette asymétrie d'entrée/sortie en fait un outil de choix pour la transcription enrichie, l'analyse et la synthèse textuelle de documents sonores.

Capacités techniques et traitement multimodal

La force de Gemini 3.5 Flash réside dans l'étendue de ses capacités et dans l'immensité de sa fenêtre de contexte. Le modèle propose :

  • Une fenêtre de contexte de 1 048 576 tokens en entrée, permettant de soumettre des heures d'enregistrement audio ou d'épais volumes de documents associés en une seule fois.
  • Une capacité de génération maximale de 65 536 tokens en sortie, ce qui autorise la production de rapports textuels extrêmement détaillés, de transcriptions intégrales ou de documents de synthèse complexes.
  • Des fonctionnalités avancées intégrées : outre la simple transcription, le modèle prend en charge le raisonnement (« thinking »), la génération de sorties structurées (comme le format JSON), l'appel de fonctions (function calling), l'exécution de code, la recherche de fichiers, la prise en compte du contexte d'URL, ainsi que le grounding (l'ancrage des réponses) via Google Search et Google Maps. Le mode « Computer Use » est également disponible en préversion.

Il est important de noter que si le modèle traite parfaitement l'audio en entrée pour délivrer du texte, il ne prend pas en charge la génération native d'audio ou d'images, et ne s'interface pas nativement avec l'API temps réel Live de Google.

Positionnement concurrentiel et performances

Google a publié des benchmarks évaluant Gemini 3.5 Flash face aux modèles phares de l'industrie, bien qu'aucune évaluation standardisée de type taux d'erreur de mots (WER) ou de caractères (CER) ne soit spécifiquement publiée pour un usage de transcription pure sous l'étiquette gemini-3.5-transcribe.

Les données partagées par Google DeepMind en mai 2026 mettent en avant les scores suivants pour Gemini 3.5 Flash : Terminal-Bench 2.1 : 76,2 % MCP Atlas : 83,6 % MMMU-Pro : 83,6 % MRCR v2 (à 128k tokens) : 77,3 %

À titre de comparaison, le fournisseur positionne son modèle légèrement en deçà de certains concurrents ultra-spécialisés ou plus massifs sur des tâches spécifiques : GPT-5.5 affiche par exemple 78,2 % sur Terminal-Bench et 94,8 % sur MRCR v2, tandis que Claude Opus 4.7 atteint 64,3 % sur SWE-Bench Pro. Ces mesures, fournies directement par Google, dépendent fortement des protocoles de test internes et doivent être considérées comme des indicateurs de performance globale plutôt que comme des mesures absolues de sa précision de transcription.

Cas d’usage industriels et limites d’utilisation

Grâce à sa nature multimodale et agentique, Gemini 3.5 Flash dépasse largement le simple cadre de la dictée numérique. Google recommande son utilisation pour des flux de travail complexes et de longue durée :

  1. Workflows décisionnels et analytiques : Vous pouvez soumettre un enregistrement de réunion (audio) ainsi que des présentations de support (PDF ou images) afin d'obtenir un compte rendu structuré, d'extraire des plans d'action et d'exécuter des requêtes de recherche d'informations croisées.
  2. Développement logiciel et processus d'entreprise : Automatisation de la documentation à partir d'ateliers de conception enregistrés, génération de code basée sur des instructions verbales, ou encore qualification automatique de supports de formation.

Limites importantes à prendre en compte : Google ne publie aucune documentation officielle garantissant des fonctionnalités de diarisation (identification des locuteurs), d'horodatage précis ou de fidélité verbatim stricte pour un modèle qui s'appellerait gemini-3.5-transcribe. De plus, aucune liste exhaustive des langues prises en charge ou de taux de précision par langue n'est documentée sous cette référence.

Par conséquent, toute intégration de ce modèle pour des besoins de transcription hautement sensibles — tels que le domaine juridique, le secteur médical, les rapports financiers ou les audits de conformité — exige impérativement une supervision humaine et un contrôle qualité rigoureux.

En matière de tarification, les coûts standards de l'API de Google pour Gemini 3.5 Flash s'élèvent à 1,50 $ par million de tokens en entrée et 9,00 $ par million de tokens en sortie (incluant les tokens de raisonnement). Sur notre plateforme, la tarification établie pour ce modèle est fixée à 30,00 $ par million de tokens en entrée et 50,00 $ par million de tokens en sortie. Le calcul s'effectuant strictement au token consommé, il n'existe pas de tarification forfaitaire à la minute d'audio transcrite.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Reconnaissance vocale

Type principal de contenu traité ou produit par ce modèle.

Reconnaissance vocale

Transcrit la parole en texte.

Audio

Traite ou produit de l'audio (voix, musique, effets).

Historique des versions

2 versions reconstituées à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Gemini 3.5 Transcribe Live

    Dernière version

    google:gemini-3.5-transcribe-live

    La solution ASR ultra-rapide de Google pour le traitement de flux audio continus par WebSocket.

    Reconnaissance vocaleAudio
    Session de streaming maximale
    10 minutes
    Format d'entrée requis
    Audio PCM 16 bits, 16 kHz mono (blocs de ~100 ms)
    Modes de rendu
    VERBATIM (fidèle) ou SMART (nettoyé et structuré)
    Langues supportées
    Plus de 85 langues avec détection et transition automatique
    Tarification API officielle
    Environ 0,009 $ / minute d'audio (0,005 $ entrée / 0,004 $ sortie)

    Tarif annoncé : 3.50 $ en entrée, 21.00 $ en sortie, par million de jetons (USD)

  2. Date non communiquée

    Gemini 3.5 Transcribe

    google:gemini-3.5-transcribe

    Fenêtre de contexte
    1 048 576 tokens
    Limite de génération
    65 536 tokens
    Tarif Entrée Plateforme
    30,00 $ / million de tokens
    Tarif Sortie Plateforme
    50,00 $ / million de tokens
    Date de sortie GA (Flash 3.5)
    19 mai 2026

    Tarif annoncé : 2.00 $ en entrée, 12.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca