Ce que fait ce modèle
Le paysage de la reconnaissance automatique de la parole (ASR) accueille une mise à jour majeure avec l'introduction du modèle qwen/qwen3-asr-flash-2026-02-10. Conçu par Alibaba et distribué via la plateforme OpenRouter, ce modèle représente une évolution significative pour les tâches de transcription audio-vers-texte.
Cette analyse technique détaille les spécificités de ce snapshot, ses capacités fonctionnelles, ses limites structurelles ainsi que son positionnement tarifaire.
Un déploiement progressif et une transition transparente
Le cycle de vie de ce modèle s'articule autour de plusieurs dates clés au premier semestre 2026. Alibaba Cloud Model Studio a initialement publié le snapshot qwen3-asr-flash-2026-02-10 le 3 mars 2026, ciblant simultanément le marché international et la Chine continentale.
Peu après, le 10 mars 2026, Alibaba a annoncé une mise à niveau automatique et transparente pour les utilisateurs de la version précédente (qwen3-asr-flash-2025-09-08). Cette transition, effective à partir du 23 mars 2026, s'est opérée sans aucune modification de la structure de facturation. Enfin, le modèle a fait son entrée sur la plateforme OpenRouter le 14 mai 2026, facilitant son accès pour les développeurs utilisant des API unifiées.
Capacités techniques et fondations du modèle
Contrairement aux modèles multimodaux généralistes, qwen3-asr-flash-2026-02-10 est un modèle purement dédié à la reconnaissance vocale (ASR). Il ne prend pas en charge la génération d'images, le chat textuel généraliste ou le raisonnement complexe.
Le modèle est bâti sur la fondation technologique Qwen3-Omni et a été entraîné sur un volume massif de données estimé à des dizaines de millions d'heures de fichiers audio et multimodaux. Cette base d'apprentissage lui confère une robustesse remarquable dans les environnements acoustiques difficiles, notamment en présence de : - Bruit de fond important - Voix distantes ou étouffées - Musique de fond - Silences prolongés
L'une des fonctionnalités clés de l'API est la possibilité de fournir un texte de contexte (context biasing). Cette option permet d'orienter le modèle en lui soumettant des listes de mots spécifiques, du jargon technique, des noms propres ou du vocabulaire métier, améliorant ainsi drastiquement la précision de la transcription sur des domaines spécialisés.
Couverture linguistique : la référence Alibaba
Bien que la fiche technique d'OpenRouter mette en avant une détection automatique centrée sur 11 langues principales, la documentation officielle d'Alibaba Cloud Model Studio confirme une compatibilité beaucoup plus large, partagée par l'ensemble de la famille Qwen-ASR. Les langues prises en charge incluent : - Le chinois (et ses dialectes) et l'anglais - Les langues asiatiques : japonais, coréen, hindi, indonésien, thaï, vietnamien, malais, philippin - Les langues européennes : français, allemand, russe, portugais, italien, espagnol, turc, ukrainien, tchèque, danois, finnois, islandais, norvégien, polonais, suédois - L'arabe
Pour optimiser la précision, l'API permet de spécifier manuellement la langue de l'audio si celle-ci est connue à l'avance.
Modalités d'intégration, formats et limites
Le modèle fonctionne principalement en mode offline (hors ligne) via une API HTTP compatible avec les standards OpenAI. Les contraintes techniques par requête sont les suivantes : - Durée maximale : 5 minutes d'audio par requête. - Taille maximale : 10 Mo par fichier.
Les formats audio acceptés par le serveur d'Alibaba sont particulièrement variés : aac, amr, aiff, flac, mp3, ogg, opus, wav, webm, wma et wmv. Pour le format brut PCM, une fréquence d'échantillonnage stricte de 16 kHz est requise. Les autres formats compressés ou alternatifs subissent un rééchantillonnage automatique côté serveur.
Au niveau des fonctionnalités secondaires : - Reconnaissance des émotions (Emotion Recognition) : Entièrement prise en charge. - Normalisation inverse du texte (ITN) : Disponible uniquement pour le chinois et l'anglais. - Diarisation (Speaker Diarization) : Non prise en charge sur cette ligne de modèles. - Option "Accuracy Boost" : Non disponible pour cette version Flash. - Streaming : Pris en charge via le mode compatible OpenAI.
Performances et tarification
Bien qu'aucun benchmark chiffré public n'ait été publié spécifiquement pour ce snapshot 2026-02-10, Alibaba affirme que cette version offre des performances supérieures à celles de la version de septembre 2025. Pour situer la famille technologique, le rapport technique Qwen3-ASR (couvrant les modèles open-weight de 0.6B et 1.7B) indique que l'architecture de 1.7B atteint un niveau SOTA (State Of The Art) parmi les modèles open-source, tandis que la version 0.6B offre un excellent compromis entre légèreté et précision.
La structure tarifaire est extrêmement avantageuse pour les développeurs, car elle repose uniquement sur la durée de l'audio envoyé : - Sur OpenRouter : 0,000035 $ par seconde d'audio (soit l'équivalent de 35 $ par million de secondes, la sortie texte étant gratuite). - Sur Alibaba Cloud International : Tarif identique de 0,000035 $ par seconde, avec un quota gratuit de 36 000 secondes offert pendant les 90 jours suivant l'activation. - Sur Alibaba Cloud Chine continentale : 0,000032 $ par seconde.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Reconnaissance vocale
Type principal de contenu traité ou produit par ce modèle.
Reconnaissance vocale
Transcrit la parole en texte.
Audio
Traite ou produit de l'audio (voix, musique, effets).
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- février 2026
Qwen3-ASR-Flash (2026-02-10)
Dernière versionqwen/qwen3-asr-flash-2026-02-10Reconnaissance vocaleAudio- Type de modèle
- Reconnaissance automatique de la parole (ASR)
- Limites par requête
- 5 minutes ou 10 Mo
- Tarif d'entrée (OpenRouter)
- 0,000035 $ / seconde d'audio
- Formats audio supportés
- aac, amr, aiff, flac, mp3, ogg, opus, wav, webm, wma, wmv
Tarif annoncé : 35.00 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)