Reconnaissance vocale

Qwen

Qwen3 Asr 0.6B

Modèle léger de reconnaissance vocale (STT) de 0,6 milliard de paramètres, offrant des transcriptions audio rapides et économiques via la plateforme OpenRouter.

Dernière version
Qwen 3 ASR 0.6B
Numéro de version
3
Type
Reconnaissance vocale
Versions recensées
1

Ce que fait ce modèle

Le modèle qwen3-asr-0.6b est une solution spécialisée dans la transcription de la parole en texte (Speech-to-Text). Grâce à son architecture compacte de 0,6 milliard de paramètres, il offre un excellent compromis entre vitesse de traitement et utilisation des ressources, ce qui le rend idéal pour la transcription en temps réel, le sous-titrage automatique ou l'indexation de contenus audio.

Disponible via la plateforme OpenRouter, ce modèle permet aux organisations d'expérimenter des fonctionnalités d'analyse audio avancées. Dans le cadre d'un déploiement avec ProductivIA et Matania, l'accès à ce type de modèle via API externe constitue une étape d'évaluation agile, facilitant la transition future vers des infrastructures de transcription entièrement souveraines et hébergées localement au Québec.

Les tarifs d'utilisation sont fixés à 3,33 $ par million de jetons en entrée (basés sur le traitement du signal audio) avec un coût de sortie nul. Une attention particulière doit être portée à la validation de ses performances sur le français québécois et ses spécificités lexicales.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Reconnaissance vocale

Type principal de contenu traité ou produit par ce modèle.

Reconnaissance vocale

Transcrit la parole en texte.

Audio

Traite ou produit de l'audio (voix, musique, effets).

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Qwen 3 ASR 0.6B

    Dernière version

    qwen/qwen3-asr-0.6b

    Reconnaissance vocaleAudio
    Type de modèle
    Reconnaissance vocale (Speech-to-Text)
    Taille du modèle
    600 millions de paramètres
    Tarif Entrée
    3,33 $ / million de jetons
    Tarif Sortie
    0,00 $
    Capacités
    Entrée audio, sortie texte

    Tarif annoncé : 3.33 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca