Ce que fait ce modèle
Le modèle gpt-realtime-whisper d'OpenAI est une solution spécialisée dans la transcription de flux audio en direct (Speech-to-Text). Grâce à ses capacités de traitement audio natif, il permet de convertir la parole en texte avec une latence minimale, ce qui le rend adapté pour les applications interactives, la dictée vocale ou le sous-titrage d'événements en direct.
Ce service est facturé uniquement sur le flux d'entrée au tarif de 0,017 $, le flux de sortie n'engendrant aucun coût additionnel sur la plateforme. Son intégration nécessite l'envoi de flux audio compatibles pour exploiter pleinement sa réactivité.
Sur le plan de la souveraineté numérique pour ProductivIA / Matania, ce modèle est opéré sur les infrastructures globales d'OpenAI. Pour les projets manipulant des données hautement sensibles ou devant répondre à des exigences strictes de localisation des données au Québec, il convient de valider la conformité de ce transfert externe ou de s'orienter vers des alternatives d'hébergement souverain.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Reconnaissance vocale
Type principal de contenu traité ou produit par ce modèle.
Reconnaissance vocale
Transcrit la parole en texte.
Audio
Traite ou produit de l'audio (voix, musique, effets).
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
Whisper Realtime
Dernière versionopenai:gpt-realtime-whisperReconnaissance vocaleAudio- Type de traitement
- Speech-to-Text (STT)
- Capacités prises en charge
- Audio, Transcription
- Tarif Entrée
- 0,017 $
- Tarif Sortie
- 0,00 $
Tarif annoncé : 0.02 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)