Ce que fait ce modèle
Dévoilé par Meta AI Research le 1er septembre 2026, Muse Voice Transcribe 1.0 constitue la première brique de « perception audio temps réel » issue des laboratoires Meta Superintelligence Labs. Intégré sur OpenRouter le 11 septembre 2026 sous l'identifiant meta/muse-voice-transcribe-1.0, ce système s'adresse exclusivement à la chaîne de traitement audio-texte. Il ne s'agit pas d'un grand modèle de langage conversationnel ou génératif, mais d'une infrastructure dédiée à la transcription automatique de la parole (ASR), à la séparation des locuteurs (diarisation) et à la détection de silence ou de fin d'énoncé (endpointing).
Une architecture autorégressive unifiée
Contrairement aux architectures traditionnelles qui chaînent plusieurs sous-systèmes distincts pour transcrire, identifier les intervenants et segmenter le signal, Muse Voice Transcribe repose sur un modèle multimodal autorégressif dérivé de la famille Muse Spark. Le traitement s'opère de manière continue : le flux audio brut est découpé en tranches régulières de 80 millisecondes (soit une fréquence de 12,5 Hz), converties en représentations vectorielles appelées « soft tokens ».
À chaque étape de calcul, le modèle évalue dynamiquement s'il doit continuer à ingérer du flux audio ou émettre des jetons textuels. La diarisation et l'endpointing sont directement encodés dans ce flux textuel via des balises spécialisées. Pour affiner la réactivité sans compromettre la fidélité, Meta a intégré un mécanisme de délai adaptatif entraîné par apprentissage par renforcement. Ce procédé permet au système d'arbitrer mot par mot entre une émission instantanée et une légère temporisation nécessaire à la résolution du contexte acoustique ou syntaxique.
Capacités linguistiques et flexibilité contextuelle
Le modèle a été entraîné sur plus de 70 langues, dont 25 bénéficient d'une validation approfondie dès sa publication. Il gère nativement le changement de langue en cours de phrase (code-switching), un comportement fréquent lors de conversations techniques ou de réunions internationales. Les intégrateurs ont également la possibilité d'injecter des biais de contexte, de langue et de mots-clés, facilitant la capture de termes rares, de noms propres ou de lexiques métiers spécifiques.
Sur le plan acoustique, le modèle prend en charge nativement des contextes audio complexes impliquant plus de 20 locuteurs distincts, et son architecture fondamentale peut traiter des sessions continues excédant une heure.
Positionnement face aux alternatives et benchmarks
Meta revendique la première place sur le banc d'essai public d'Artificial Analysis au 1er septembre 2026, à la fois pour la transcription en streaming et pour les tâches de diarisation. Des évaluations tierces indépendantes confirment ce niveau de précision lexicale. Sur le benchmark Pipecat portant sur 1 000 extraits avec mesure du WER (Word Error Rate) sémantique, Muse Voice Transcribe affiche un taux d'erreur agrégé particulièrement bas de 0,83 %, avec 89,2 % de transcriptions sans aucune faute, devançant les autres solutions référencées dans l'étude.
En matière de réactivité brute, le modèle se distingue par une latence médiane de 392 ms pour la transcription finale. Néanmoins, son comportement en queue de distribution s'avère plus variable, avec une latence au 99e percentile (P99) s'élevant à 1 922 ms. Cette variabilité, due à l'arbitrage adaptatif, le rend légèrement moins prévisible sur les scénarios ultra-stricts que des moteurs comme Deepgram Nova-3 ou Soniox, bien qu'il offre un compromis de précision sémantique supérieur.
Cas d'usage et contraintes opérationnelles
Grâce à sa gestion unifiée de l'attribution des locuteurs et du flux synchrone, Muse Voice Transcribe est particulièrement adapté aux domaines suivants :
- Les agents vocaux conversationnels nécessitant une détection précise des tours de parole et un push-to-talk réactif.
- La transcription de réunions, interviews, podcasts et appels téléphoniques rassemblant de multiples intervenants.
- Le sous-titrage en direct et la dictée professionnelle intégrant du vocabulaire technique via le guidage contextuel.
Certaines limitations techniques doivent toutefois être prises en compte lors de l'intégration, notamment via la passerelle OpenRouter :
- Format d'entrée strict : OpenRouter impose l'envoi de fichiers au format WAV PCM mono 16 bits, échantillonnés exclusivement à 16 ou 24 kHz. Les formats compressés (MP3, AAC, Opus) doivent faire l'objet d'un prétraitement avant transmission.
- Limite temporelle par requête : si le modèle supporte théoriquement plus d'une heure, OpenRouter bride chaque envoi à une durée maximale de 10 minutes.
- Métadonnées restreintes : l'API ne retourne ni horodatage mot à mot (word-level timestamps) ni indices de confiance numériques, restreignant son usage pour les outils de montage vidéo qui nécessitent un calage temporel granulaire.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Reconnaissance vocale
Type principal de contenu traité ou produit par ce modèle.
Fichiers
Peut s'appuyer sur des fichiers joints (documents, extraits) en plus du texte.
Reconnaissance vocale
Transcrit la parole en texte.
Audio
Traite ou produit de l'audio (voix, musique, effets).
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
Muse Voice Transcribe 1.0
Dernière versionmeta/muse-voice-transcribe-1.0FichiersReconnaissance vocaleAudio- Type de modèle
- Reconnaissance vocale (ASR), Diarisation et Endpointing
- Architecture
- Multimodale autorégressive (Muse Spark), tranches de 80 ms
- Couverture linguistique
- 70+ langues à l'entraînement, 25 validées, code-switching
- Capacité de diarisation
- Plus de 20 locuteurs
- Précision sémantique (Pipecat)
- 0,83 % de WER agrégé, 89,2 % de transcriptions parfaites
- Latence (Pipecat)
- 392 ms (médiane) / 1 922 ms (P99)
- Formats acceptés (OpenRouter)
- WAV PCM mono 16 bits, 16 ou 24 kHz
- Limite par requête (OpenRouter)
- 10 minutes
- Tarification
- 0,18 $ par heure d'audio
Tarif annoncé : 50.00 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)