Ce que fait ce modèle
Introduction : Décryptage de l'identifiant gpt-live-transcribe
Lors de l'évaluation des technologies vocales d'OpenAI, l'identifiant exact « gpt-live-transcribe » apparaît fréquemment dans les discussions techniques. Cependant, au 28 juillet 2026, aucune annonce officielle, fiche de modèle, documentation API ou grille tarifaire d'OpenAI ne référence cet identifiant précis. Il convient donc d'établir une distinction rigoureuse : cet identifiant semble résulter d'une confusion entre deux offres vocales distinctes et majeures publiées par OpenAI : d'une part, GPT-Realtime-Whisper, dédié à la transcription audio en temps réel via l'API, et d'autre part, GPT-Live, conçu pour la conversation vocale interactive au sein de ChatGPT.
Pour les professionnels de l'intelligence artificielle, comprendre la séparation de ces deux architectures est essentiel pour concevoir des intégrations applicatives robustes et performantes.
GPT-Realtime-Whisper : La transcription en flux continu
Présenté officiellement dans le cadre des avancées de l'intelligence vocale d'OpenAI, le modèle GPT-Realtime-Whisper est spécifiquement conçu pour la reconnaissance vocale en flux (« streaming speech-to-text »). Sa modalité principale est strictement définie : il prend de l'audio en entrée et génère du texte en sortie.
Contrairement à d'autres modèles de la gamme Realtime, GPT-Realtime-Whisper ne revendique aucune capacité de raisonnement autonome, de génération d'images, de vision ou de synthèse vocale (TTS). Il se concentre exclusivement sur la transcription fidèle et immédiate de la parole au fur et à mesure qu'elle est prononcée.
Sur le plan technique, OpenAI n'a pas divulgué publiquement de données chiffrées concernant la fenêtre de contexte, la limite de longueur de sortie, le taux d'erreur par mot (WER), la latence exacte ou les langues prises en charge. De même, aucun benchmark comparatif officiel face à des concurrents du marché (tels que Deepgram, Google ou ElevenLabs) n'a été fourni dans les annonces de lancement. Le tarif officiel annoncé pour ce modèle au sein de la Realtime API est de 0,017 $ US par minute.
GPT-Live : L'alternative conversationnelle full-duplex
Il est crucial de ne pas confondre le moteur de transcription pur avec GPT-Live, lancé le 8 juillet 2026 sous les variantes GPT-Live-1 et GPT-Live-1 mini. Ce dernier propulse la fonctionnalité vocale avancée de ChatGPT.
À l'inverse d'un simple transcripteur, GPT-Live repose sur une architecture « full-duplex » capable d'écouter et de répondre simultanément. Ce modèle gère nativement les interruptions, les silences et le rythme naturel d'une conversation humaine. De plus, il peut déléguer les requêtes complexes de recherche ou de raisonnement approfondi à un modèle de frontière sous-jacent.
Dans l'application ChatGPT, GPT-Live interagit de manière multimodale avec le texte et les images au sein d'une même session, accédant à la mémoire de l'utilisateur ou affichant des résultats visuels sous forme de widgets. Les évaluations internes publiées par OpenAI comparent GPT-Live à l'ancien mode vocal avancé (Advanced Voice Mode), affichant des gains notables sur des benchmarks tels que GPQA, BrowseComp et une variante interne de τ³-Voice Telecom, bien que les scores numériques complets ne soient pas détaillés.
Cas d'usage pratiques et limites technologiques
L'adoption de ces technologies dépend directement des besoins applicatifs :
- Pour GPT-Realtime-Whisper (Transcription) : Les cas d'usage recommandés incluent le sous-titrage en direct d'événements, la transcription de réunions, de cours ou de diffusions en temps réel, la prise de notes progressive, ainsi que l'intégration dans les flux de support client, de recrutement, de vente et de santé où la compréhension continue de la parole est requise.
- Pour GPT-Live (Conversation) : Ce modèle est idéal pour les assistants virtuels interactifs et le support client bidirectionnel.
Chaque approche comporte des limites strictes. GPT-Realtime-Whisper se cantonne à la transcription sans génération de retour vocal. De son côté, GPT-Live ne prend pas en charge le partage d'écran ou de vidéo à son lancement. De plus, OpenAI signale des limites de fluidité pour certaines langues et certains accents, ainsi que des perturbations potentielles liées au bruit ambiant, aux chevauchements de voix et aux interruptions intempestives.
Une fois activé, les tarifs configurés pour ce modèle sur la plateforme s'établissent à 30,00 $ US par million de tokens en entrée et 50,00 $ US par million de tokens en sortie. Cette tarification basée sur les tokens s'applique aux interactions traitées via la plateforme, complétant l'offre d'OpenAI pour s'adapter à vos besoins de traitement de volume.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Reconnaissance vocale
Type principal de contenu traité ou produit par ce modèle.
Reconnaissance vocale
Transcrit la parole en texte.
Audio
Traite ou produit de l'audio (voix, musique, effets).
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
gpt-live-transcribe
Dernière versionopenai:gpt-live-transcribeReconnaissance vocaleAudio- Tarif API (Realtime-Whisper)
- 0,017 $ / minute
- Tarif plateforme (Entrée)
- 30,00 $ / million de tokens
- Tarif plateforme (Sortie)
- 50,00 $ / million de tokens
- Statut plateforme
- Détecté (Désactivé par défaut)
Tarif annoncé : 0.02 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)