Reconnaissance vocale

GoogleÉtats-Unis

Chirp 3

Google Chirp 3, le modèle ASR de pointe de Google Cloud, désormais disponible pour la transcription audio-vers-texte sur OpenRouter.

Dernière version
google/chirp-3
Numéro de version
3
Type
Reconnaissance vocale
Versions recensées
1

Ce que fait ce modèle

L'évolution des technologies de reconnaissance vocale automatique (ASR) franchit une nouvelle étape avec l'introduction de Google Chirp 3 sur la plateforme OpenRouter. Conçu spécifiquement pour la transcription de l'audio vers le texte, ce modèle représente la dernière génération des technologies de reconnaissance vocale multilingue de Google Cloud. Il convient de préciser d'emblée que si l'appellation « Chirp 3 » englobe également des capacités de synthèse vocale (Text-to-Speech) au sein de l'écosystème Google Cloud, la déclinaison proposée sur OpenRouter sous l'identifiant google/chirp-3 se concentre exclusivement sur la transcription de l'audio vers le texte.

Le parcours de ce modèle témoigne de sa maturité technologique. Introduit en version préliminaire privée (Private Preview) le 11 avril 2025, puis en version publique (Public Preview) le 29 août 2025, Chirp 3 a atteint sa disponibilité générale (GA) le 13 octobre 2025 sur Google Cloud. Son intégration sur OpenRouter est quant à elle datée du 5 mai 2026.

Capacités techniques et modalités d'intégration

Le modèle Chirp 3 se distingue par une modalité unique : l'entrée audio produit une sortie textuelle. Contrairement aux modèles de langage classiques (LLM), la notion de fenêtre de contexte exprimée en tokens n'est pas applicable ici. Les limites opérationnelles sont définies par la durée des fichiers audio traités.

Sous l'API Google Speech-to-Text V2, le modèle prend en charge trois méthodes principales : - La méthode Recognize pour les fichiers courts de moins d'une minute. - La méthode StreamingRecognize dédiée à la transcription en temps réel. - La méthode BatchRecognize pour les fichiers longs, allant de 1 minute à 1 heure (cette limite est ramenée à 20 minutes si l'horodatage au niveau du mot est activé).

Sur OpenRouter, l'intégration s'effectue via un appel POST standardisé vers l'endpoint /api/v1/audio/transcriptions, en transmettant l'audio encodé en base64.

Fonctionnalités avancées pour les professionnels

Chirp 3 intègre un ensemble de fonctionnalités haut de gamme pour optimiser la qualité des transcriptions : - Détection automatique de la langue : Idéal pour les flux audio multilingues. - Ponctuation et capitalisation automatiques : Pour un rendu textuel immédiatement exploitable. - Diarisation : Identification des différents locuteurs, bien que cette option soit restreinte à certaines langues et méthodes. - Adaptation au vocabulaire : Personnalisation pour les termes techniques ou les noms propres. - Prompts de formatage : Disponibles en préversion pour guider le style de sortie. - Débruiteur intégré : Pour purifier le signal audio des bruits de fond indésirables.

Positionnement et performances : Un leader premium

Sur le plan des performances, Google annonce des gains significatifs en termes de précision et de rapidité par rapport aux versions précédentes de Chirp. Bien que Google ne publie pas de benchmarks chiffrés officiels, des tests indépendants menés par OpenTranscription positionnent Chirp 3 au premier rang sur un panel de 28 modèles évalués.

Ce benchmark tiers lui attribue un taux d'erreur par mot (WER) de 14,05 %, un taux d'erreur par caractère (CER) de 8,65 % et une latence moyenne de 10,3 secondes. Ces résultats le classent comme une solution premium, face à des alternatives plus économiques telles que Qwen3 ASR Flash.

Cas d'usage et limites du modèle

Les entreprises trouveront dans Chirp 3 un outil idéal pour : - La transcription de réunions multi-intervenants et d'appels téléphoniques. - Le sous-titrage automatisé de vidéos. - L'indexation de contenus audiovisuels volumineux. - L'intégration dans des flux de travail complexes exigeant une forte robustesse multilingue.

Cependant, le modèle comporte des limites strictes. Il ne s'agit pas d'un modèle de chat, de vision ou de raisonnement : il est incapable de générer du texte libre ou de répondre à des questions. De plus, son système de débruitage, bien qu'efficace contre les bruits de fond, ne permet pas de filtrer les voix humaines secondaires en arrière-plan.

Le modèle est proposé sur OpenRouter au tarif de 0,016 $ par minute d'audio. À titre de comparaison, le tarif standard de Google Cloud débute également à 0,016 $ la minute (avec des tarifs dégressifs par paliers et une option "Dynamic Batch" à 0,003 $ la minute, non documentée sur OpenRouter).

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Reconnaissance vocale

Type principal de contenu traité ou produit par ce modèle.

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Reconnaissance vocale

Transcrit la parole en texte.

Audio

Traite ou produit de l'audio (voix, musique, effets).

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Chirp 3

    Dernière version

    google/chirp-3

    OutilsReconnaissance vocaleAudio
    Type de modèle
    Reconnaissance vocale automatique (ASR)
    Tarif OpenRouter
    0,016 $ / minute
    Limites d'usage (Batch)
    1 minute à 1 heure (20 min avec horodatage)
    Performance (WER)
    14,05 % (selon OpenTranscription)

    Tarif annoncé : 266.67 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca