Ce que fait ce modèle
Analyse de Fish Audio Transcribe 1 : La transcription enrichie et multilingue sur OpenRouter
## Présentation du modèle et proposition de valeur Le domaine de la reconnaissance automatique de la parole (ASR ou Speech-to-Text) s'enrichit d'un nouvel acteur spécialisé avec l'arrivée de Transcribe 1, développé par Fish Audio. Référencé sur la plateforme OpenRouter sous l'identifiant fish-audio/transcribe-1 (et enregistré sous le slug canonique fish-audio/transcribe-1-20260729), ce modèle marque une étape importante dans l'accès aux technologies de transcription hautement spécialisées. Bien que son intégration sur OpenRouter soit datée du 29 juillet 2026, Fish Audio indique que sa technologie de transcription était déjà opérationnelle dès mars 2026.
Transcribe 1 se distingue des modèles de langage généralistes en se concentrant exclusivement sur la conversion de signaux audio en texte. Sa proposition de valeur repose sur une double promesse : une grande fidélité de transcription dans un contexte multilingue et la capacité théorique à capturer la dimension paralinguistique des échanges verbaux.
## Capacités techniques et modalités de traitement Sur le plan fonctionnel, Transcribe 1 est un modèle strictement unidirectionnel : il accepte des fichiers audio en entrée et produit une transcription textuelle en sortie. Il ne dispose d'aucune capacité de vision, de génération d'images, de synthèse vocale ou de raisonnement textuel pur.
Selon les spécifications d'OpenRouter, le modèle intègre une détection automatique de la langue et peut restituer des segments horodatés à l'échelle du mot lorsque des détails d'alignement précis sont requis par l'utilisateur.
Au-delà de ces fonctions de base, le moteur STT de Fish Audio revendique des capacités avancées sur son interface native : - La transcription de contenus de longue durée. - La diarisation et la détection des locuteurs, permettant d'identifier précisément qui parle et quand. - L'intégration de balises automatiques d'émotions et d'événements paralinguistiques (tels que les pauses, les rires, les soupirs ou les bruits de respiration). - La prise en charge de plus de 100 langues et dialectes, avec une optimisation poussée pour l'anglais, le mandarin, le cantonais, le japonais et le coréen, y compris pour les flux audio multilingues.
Il convient toutefois de souligner une nuance importante pour les développeurs utilisant l'API OpenRouter : certaines de ces fonctionnalités avancées (comme l'export direct aux formats SRT ou VTT, le réglage manuel du nombre de locuteurs ou l'extraction complète des balises d'émotions) ne sont pas explicitement documentées comme disponibles via le canal OpenRouter. La réponse standardisée d'OpenRouter se concentre principalement sur le texte transcrit et les métriques d'usage.
## Positionnement face aux solutions existantes À l'heure actuelle, Fish Audio n'a pas publié de données d'évaluation standardisées, telles que le taux d'erreur par mot (WER - Word Error Rate) ou le taux d'erreur par caractère (CER - Character Error Rate). Il n'existe pas non plus de benchmarks comparatifs indépendants ou quantitatifs opposant Transcribe 1 à des références établies du marché comme Whisper d'OpenAI, Deepgram, Grok STT, Voxtral ou Parakeet.
Par conséquent, toute affirmation de supériorité technique absolue serait prématurée. Le positionnement de Transcribe 1 se veut avant tout différencié. Plutôt que de concourir uniquement sur la précision brute du texte, Fish Audio mise sur la richesse contextuelle de la transcription conversationnelle multi-locuteurs et sur la préservation d'indices expressifs. Ces indices s'avèrent particulièrement précieux lorsqu'ils sont réutilisés en synergie avec l'écosystème de synthèse vocale (TTS) du fournisseur.
## Cas d'usage concrets et limites du modèle L'intégration de Transcribe 1 s'avère particulièrement pertinente pour plusieurs scénarios professionnels : - Sous-titrage et post-production : Génération de scripts temporels pour les vidéos et les contenus multimédias. - Podcasts et interviews : Transcription fidèle d'échanges dynamiques impliquant plusieurs interlocuteurs, facilitant la mise en page sous forme de dialogues. - Comptes rendus de réunions : Automatisation de la prise de notes avec distinction des intervenants. - Archives audio consultables : Indexation de grands volumes de fichiers vocaux pour la recherche textuelle.
Cependant, les utilisateurs doivent composer avec plusieurs limites techniques. La fenêtre de contexte affichée par OpenRouter est de 0, et aucun paramètre de longueur maximale de sortie (max_completion_tokens) n'est défini de manière classique pour ce type d'API de transcription. La limite de durée audio par requête doit donc être considérée comme non divulguée. En pratique, l'infrastructure d'OpenRouter impose un délai de traitement amont d'environ 60 secondes et recommande de segmenter les fichiers audio volumineux. L'API accepte les envois en Base64 ou en multipart jusqu'à une limite de 25 Mo. Enfin, la dépendance aux spécificités de l'API OpenRouter peut restreindre l'accès aux métadonnées les plus riches du modèle natif.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Reconnaissance vocale
Type principal de contenu traité ou produit par ce modèle.
Reconnaissance vocale
Transcrit la parole en texte.
Audio
Traite ou produit de l'audio (voix, musique, effets).
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
Fish Audio Transcribe 1
Dernière versionfish-audio/transcribe-1Reconnaissance vocaleAudio- Fenêtre de contexte
- Non divulguée (0 sur OpenRouter)
- Tarif d'entrée
- 0,0001 $ / token (100 $ / M tokens)
- Tarif de sortie
- 0,00 $
- Format d'entrée
- Audio (Base64 ou multipart jusqu'à 25 Mo)
Tarif annoncé : 100.00 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)