Reconnaissance vocale

Microsoft

Mai Transcribe 2

Modèle de reconnaissance vocale de Microsoft, proposé via OpenRouter pour la transcription efficace de contenus audio en texte à un coût d'entrée très compétitif.

Dernière version
microsoft/mai-transcribe-2
Numéro de version
2
Type
Reconnaissance vocale
Versions recensées
1

Ce que fait ce modèle

Le modèle microsoft/mai-transcribe-2 est une solution spécialisée dans la transcription de la parole en texte (Speech-to-Text). Développé par Microsoft et rendu accessible via l'API d'OpenRouter, il est conçu pour convertir des fichiers ou des flux audio en contenu écrit de manière structurée.

Ses usages typiques incluent la transcription d'entretiens, la génération de sous-titres, la consignation de réunions et l'analyse de données vocales. Sa tarification sur OpenRouter se distingue par un coût très avantageux de 0,10 $ par million de jetons en entrée, avec une gratuité complète sur les jetons de sortie.

Dans le cadre d'un déploiement au Québec, les organisations soucieuses de la souveraineté numérique et de la protection des données doivent prendre en compte que le traitement transite par des infrastructures tierces (OpenRouter et Microsoft). Il convient donc de valider la conformité de ces flux externes avec les exigences locales de confidentialité avant d'y soumettre des informations hautement sensibles.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Reconnaissance vocale

Type principal de contenu traité ou produit par ce modèle.

Fichiers

Peut s'appuyer sur des fichiers joints (documents, extraits) en plus du texte.

Reconnaissance vocale

Transcrit la parole en texte.

Audio

Traite ou produit de l'audio (voix, musique, effets).

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    MAI Transcribe 2

    Dernière version

    microsoft/mai-transcribe-2

    FichiersReconnaissance vocaleAudio
    Type principal
    Speech-to-Text (STT)
    Tarif Entrée
    0,10 $ / million de jetons
    Tarif Sortie
    Gratuit (0,00 $)
    Capacités
    Traitement audio, transcription
    Éditeur original
    Microsoft

    Tarif annoncé : 0.10 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca