Texte

OpenAIÉtats-Unis

GPT Live 1

Le modèle vocal temps réel d'OpenAI doté d'une architecture full duplex et d'un système de délégation backend.

Dernière version
GPT-Live-1
Numéro de version
1
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Présentation et positionnement de GPT-Live-1

Dévoilée initialement le 8 juillet 2026 lors de la présentation de la famille GPT-Live, la technologie vocale d'OpenAI a marqué une étape importante dans l'interaction homme-machine temps réel. Dès son lancement, GPT-Live-1 est devenu le moteur vocal par défaut au sein de ChatGPT pour les abonnements Go, Plus et Pro, tandis qu'une déclinaison allégée, GPT-Live-1 mini, a été réservée à l'offre gratuite. OpenAI a ensuite formalisé la mise à disposition de l'identifiant précis gpt-live-1 pour les développeurs via son API le 10 septembre 2026.

Contrairement aux modèles de fondation généralistes traditionnels axés principalement sur le raisonnement textuel lourd, GPT-Live-1 se positionne explicitement comme une couche conversationnelle spécialisée dans le traitement audio en flux continu. Son rôle premier n'est pas de remplacer les grands modèles de langage autonomes, mais d'orchestrer une expérience de dialogue oral fluide, réactive et naturelle.

Architecture full duplex et fonctionnement par délégation

La principale avancée technique de GPT-Live-1 réside dans son architecture nativement full duplex. Le modèle est capable d'écouter et de parler de manière simultanée. Cette conception lui permet de discerner le moment opportun pour écouter, marquer une pause, répondre ou interrompre son interlocuteur. Le système gère avec souplesse les hésitations du locuteur, les bruits ambiants, les chevauchements de paroles et les bifurcations thématiques soudaines.

En matière de modalités, GPT-Live-1 traite et génère exclusivement du texte et de l'audio. Il n'accepte ni image ni vidéo en entrée directe, et n'intègre pas de génération graphique native. Le modèle expose des flux de streaming, fournit les transcriptions ASR (reconnaissance vocale), génère le texte de ses réponses et permet la traduction vocale en direct tout en supportant les appels d'outils (function calling).

Pour surmonter l'absence de vision native et de moteur de raisonnement lourd, OpenAI a bâti ce système sur un principe de délégation. Lorsque des opérations complexes sont requises — telles que la recherche sur le Web, l'analyse visuelle ou l'exécution d'outils avancés —, GPT-Live-1 transmet la requête à un modèle d'arrière-plan (backend) configuré par le développeur. Dans ChatGPT, ce rôle était assuré au lancement par GPT-5.5. Dans le cadre de l'API, les intégrateurs peuvent coupler GPT-Live-1 au modèle de leur choix et ajuster le niveau d'effort de raisonnement associé. Si un utilisateur soumet une image ou un flux visuel, le document doit d'abord transiter par le backend doté de vision, qui renvoie ensuite une synthèse textuelle exploitable par GPT-Live-1 pour alimenter la conversation orale.

Spécifications techniques et gestion du contexte

Sur le plan technique, GPT-Live-1 propose une fenêtre de contexte globale de 128 000 tokens. Cette enveloppe englobe les instructions système, le texte transcrit de la conversation ainsi que des tokens audio spécifiques qui n'apparaissent pas dans les transcriptions textuelles.

Un mécanisme strict de compactage intervient lorsque l'occupation du contexte dépasse 90 %. Dans ce cas de figure, le moteur tronque et résume automatiquement l'historique : il préserve les instructions initiales ainsi qu'un volume maximal de 8 192 tokens regroupant l'historique récent ou condensé. Ce fonctionnement implique que des données précises évoquées plus tôt dans l'échange peuvent disparaître. Il revient donc aux concepteurs d'applications de maintenir l'état métier et les variables critiques au niveau applicatif.

Par ailleurs, les contraintes d'initialisation de session sont précisément encadrées : - Les instructions initiales peuvent atteindre jusqu'à 16 384 tokens. - L'historique textuel injecté au démarrage est plafonné à 128 messages et 8 192 tokens.

OpenAI n'a pas publié de limite formelle concernant le plafond de tokens générés par réponse individuelle, ni de durée maximale fixe pour une session continue.

Évaluations de performance et benchmarks

Sur le terrain des performances, OpenAI rapporte une nette amélioration face à ses solutions antérieures. Sur le benchmark interne Full Duplex Bench, GPT-Live-1 affiche un gain de 30 points par rapport au précédent modèle GPT-Realtime-2.1, traduisant une meilleure synchronisation de la prise de parole et de l'écoute active.

Sur le benchmark Tau3, dédié aux tâches de service client vocales de bout en bout, OpenAI a évalué la solution en associant GPT-Live-1 à un backend GPT-6 Astra (configuré avec un effort de raisonnement moyen). Dans cette configuration composite, le système atteint : - Un taux de réussite au premier essai de 83,6 % (contre 45,7 % pour GPT-Realtime-2.1). - Une latence moyenne de prise de tour réduite à 0,798 seconde, contre 1,41 seconde auparavant.

Il convient de noter que ces mesures fournies par le constructeur reflètent les performances de l'ensemble (couche vocale et backend de raisonnement) et ne permettent pas d'isoler l'impact pur de GPT-Live-1. De plus, aucune comparaison directe avec des solutions vocales concurrentes tierces n'a été publiée à ce jour.

Cas d'usage cibles, limites et réserves de sécurité

Le modèle est conçu en priorité pour les environnements interactifs où la réactivité vocale est déterminante. Parmi les cas d'usage préconisés figurent les agents téléphoniques de support client, les plateformes de prise de rendez-vous automatisées, les tuteurs d'apprentissage linguistique interactifs, ainsi que les copilotes vocaux destinés aux développeurs et agents métier.

Plusieurs limites structurelles doivent néanmoins être prises en compte lors de l'intégration : - Absence de prise en charge native de la vidéo et des images sans modèle tiers. - Impossibilité d'obtenir des sorties strictement structurées (ex. JSON forcé). - Absence d'options de personnalisation par fine-tuning. - Variabilité de fluidité et d'accentuation selon les langues. - Interdiction et impossibilité technique de cloner ou d'imiter des voix humaines réelles.

Sur le plan de l'alignement et de la sécurité, le rapport officiel d'OpenAI signale également une légère régression sur son indicateur d'évaluation mesurant la dépendance émotionnelle (emotional reliance) par rapport à l'ancienne génération vocale, appelant à la vigilance dans les contextes grand public.

Au niveau de l'API OpenAI officielle, la couche vocale GPT-Live-1 est facturée à l'usage au tarif de 0,05 USD par minute, avec un décompte à la seconde. Le modèle backend de raisonnement et l'exécution éventuelle d'outils font l'objet d'une facturation distincte selon leurs grilles respectives.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Synthèse vocale

Transforme du texte en parole.

Reconnaissance vocale

Transcrit la parole en texte.

Audio

Traite ou produit de l'audio (voix, musique, effets).

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    GPT-Live-1

    Dernière version

    openai:gpt-live-1

    OutilsSynthèse vocaleReconnaissance vocaleAudio
    Fenêtre de contexte
    128 000 jetons
    Fenêtre de contexte
    128 000 tokens
    Modalités d'entrée
    Audio, Texte
    Modalités de sortie
    Audio, Texte
    Architecture
    Full duplex avec délégation backend
    Tarification API OpenAI
    0,05 USD / minute
    Latence de prise de tour
    0,798 s (avec backend)

    Tarif annoncé : 0.05 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca