Ce que fait ce modèle
Une rupture technologique et tarifaire dans la synthèse vocale
Le domaine de la synthèse vocale (Text-to-Speech ou TTS) connaît une accélération remarquable avec l'introduction de solutions de plus en plus fluides et accessibles. Le modèle Fish Audio S2.1 Pro Free (fish-audio/s2.1-pro-free:free) s'inscrit directement dans cette dynamique. Annoncé le 23 juin 2026 par l'éditeur Fish Audio, ce modèle correspond à la variante gratuite de développement de leur système phare, S2.1 Pro.
Cette gratuité temporaire, initialement lancée dans un contexte d'optimisation d'infrastructure, a été prolongée jusqu'au 31 août 2026 sous réserve d'un usage raisonnable. Pour parvenir à proposer un tel modèle sans coût de licence, Fish Audio a massivement optimisé son pipeline d'inférence. L'intégration de noyaux CUDA dédiés, la quantification au format FP8 et l'implémentation du batching continu ont permis de réduire drastiquement les coûts de calcul, rendant cette offre de développement viable pour les créateurs et les entreprises.
Des capacités avancées de génération et de clonage
S2.1 Pro Free est un modèle strictement dédié à la modalité texte-vers-audio. Il reçoit du texte brut et génère une parole réaliste, exportable dans des formats standards tels que le MP3, le WAV/PCM ou l'Opus.
Ses principales fonctionnalités incluent : - Un support multilingue étendu : Le modèle prend en charge 83 langues et intègre un système de détection automatique de la langue source. - Le streaming à faible latence : Essentiel pour les interactions en temps réel. - Le clonage vocal : Il est possible de cloner une voix de manière instantanée à partir d'un ou plusieurs extraits audio de référence, ou de créer un modèle de voix persistant. - Le contrôle stylistique en langage naturel : Contrairement aux systèmes TTS traditionnels qui nécessitent des curseurs complexes, S2.1 Pro Free interprète des instructions paralinguistiques directement insérées dans le texte sous forme de balises entre crochets, comme [whispers sweetly] (chuchote doucement) ou [laughing nervously] (rit nerveusement).
Il convient de préciser les limites applicatives de ce modèle : il ne s'agit pas d'un grand modèle de langage (LLM) conversationnel, ni d'un outil de vision, de raisonnement, de génération d'images ou de transcription. De plus, bien que la famille S2.1 évoque le dialogue multi-locuteurs, la documentation de l'API précise que cette fonctionnalité spécifique est réservée au modèle payant S2-Pro et n'est pas disponible sur la version S2.1 Pro Free.
Gestion du contexte et limites techniques
Fish Audio ne publie pas de dimensionnement de « fenêtre de contexte » exprimé en tokens de texte pour ce modèle. À la place, l'API fonctionne par segmentation.
Le texte d'entrée est découpé en segments d'une longueur définie par le paramètre chunk_length, qui varie de 100 à 300 caractères (avec une valeur par défaut fixée à 300). Une option de continuité vocale permet d'assurer la fluidité de la transition d'un segment à l'autre. En sortie, la limite de génération est fixée par défaut à 1 024 tokens audio par segment (via le paramètre max_new_tokens). Cette segmentation n'empêche pas la génération de contenus longs, comme des livres audio, qui doivent simplement être traités par lots de segments successifs.
Performances revendiquées et positionnement concurrentiel
Sur le plan des performances, Fish Audio affiche des mesures internes particulièrement compétitives : - Une latence de 70 à 90 millisecondes jusqu'à la réception du premier octet audio (Time to First Audio ou TTFT), selon le chemin d'accès API utilisé. - Un débit supérieur à 8 000 tokens audio par seconde lors de requêtes concurrentes (mesuré à 64 requêtes simultanées sur GPU NVIDIA H200). - Un débit sous charge plus de deux fois supérieur à celui de la génération précédente, S2 Pro.
Lors de tests d'écoute comparatifs menés par l'éditeur, S2.1 Pro a obtenu un taux de préférence de 61 % face à S2 Pro. De plus, un benchmark basé sur 5 098 comparaisons A/B sur du trafic web a montré que S2 Pro devançait ElevenLabs V3 avec un taux de victoire de 60 % contre 40 % dans leur face-à-face direct. Il convient toutefois de traiter ces chiffres avec la prudence de rigueur : ces évaluations ont été réalisées par Fish Audio lui-même, excluent les utilisateurs de l'API et comportent des biais potentiels liés au routage ou à la familiarité des évaluateurs avec la plateforme.
Cas d'usage, limites et tarification
Le modèle S2.1 Pro Free est particulièrement recommandé pour plusieurs scénarios : - Le prototypage rapide d'applications audio. - Le développement d'agents vocaux conversationnels en temps réel. - La narration de contenus et la création de livres audio. - Le doublage et la localisation linguistique de vidéos. - La création de voix de personnages pour le jeu vidéo ou le divertissement.
Cependant, la gratuité s'accompagne de contreparties importantes. Fish Audio n'offre aucune garantie de latence, de disponibilité de service (SLA) ou d'accord de traitement des données (DPA). L'éditeur se réserve également le droit de conserver les requêtes soumises afin d'améliorer ses modèles. Enfin, des restrictions commerciales s'appliquent, notamment pour les entreprises dépassant 1 million de dollars de revenus annuels récurrents (ARR).
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Synthèse vocale
Type principal de contenu traité ou produit par ce modèle.
Synthèse vocale
Transforme du texte en parole.
Audio
Traite ou produit de l'audio (voix, musique, effets).
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
Fish Audio S2.1 Pro Free
Dernière versionfish-audio/s2.1-pro-free:freeSynthèse vocaleAudio- Type de modèle
- Synthèse vocale (Text-to-Speech)
- Langues prises en charge
- 83 langues avec détection automatique
- Segmentation du texte
- 100 à 300 caractères (par défaut 300)
- Limite par segment
- 1 024 tokens audio (max_new_tokens)
- Latence (TTFT)
- 70 à 90 ms
- Tarif OpenRouter
- 0 $ / million de tokens