Ce que fait ce modèle
Introduction et positionnement
Début mars 2026, l'écosystème de l'intelligence artificielle vocale a franchi une étape significative avec la publication du rapport technique de Fish Audio S2 Pro. Déposé sur arXiv le 9 mars 2026 et révisé le 11 mars, ce modèle de synthèse vocale (TTS) multilingue se distingue par une approche d'accessibilité hybride. Fish Audio propose en effet les poids du modèle, le code de fine-tuning ainsi qu'un moteur d'inférence optimisé basé sur SGLang. Toutefois, l'exploitation de ce modèle est régie par la Fish Audio Research License, qui autorise un usage gratuit pour la recherche et les applications non commerciales, tout en exigeant une licence spécifique pour toute exploitation commerciale.
Capacités et modalités : Le contrôle fin par balises naturelles
Fish Audio S2 Pro est un modèle spécialisé de texte-vers-audio (Text-to-Speech). Contrairement à certains modèles multimodaux récents, il ne s'agit pas d'un système généraliste capable de raisonnement textuel, de vision par ordinateur ou de transcription. Sa fonction première est de convertir un script textuel en une parole d'un grand réalisme, avec la possibilité d'intégrer un ou plusieurs extraits audio de référence pour réaliser du clonage vocal.
L'innovation majeure de S2 Pro réside dans son mécanisme de contrôle local de la voix. Plutôt que de s'appuyer sur un ensemble rigide et prédéfini de balises de style, le modèle interprète des instructions en langage naturel insérées directement entre crochets au sein du texte (par exemple, [whisper], [laugh] ou [speak slowly]). Ces directives peuvent être appliquées de manière extrêmement granulaire, au niveau d'un mot ou d'une phrase entière, influençant directement la prosodie, les émotions, le rythme des pauses et l'insertion de sons paralinguistiques.
De plus, le modèle prend en charge nativement plus de 80 langues, dont le français, avec un système de détection automatique de la langue. Il gère également les dialogues multi-locuteurs et multi-tours de manière native. Dans l'API de Fish Audio, cette fonctionnalité est orchestrée via des balises spécifiques telles que <|speaker:n|> combinées à l'utilisation de plusieurs références vocales distinctes.
Architecture technique et limites opérationnelles
Sur le plan architectural, Fish Audio S2 Pro affiche environ 5 milliards de paramètres. Cette structure se compose d'un réseau principal « Slow AR » (autorégressif) de 4 milliards de paramètres, couplé à un décodeur « Fast AR » de 400 millions de paramètres, le tout s'appuyant sur un codec RVQ (Residual Vector Quantization) à dix codebooks.
Bien que l'entraînement progressif du modèle ait été poussé jusqu'à 16 384 tokens, le rapport technique précise que l'évaluation sur de longs formats applique une limite opérationnelle de 8 192 tokens. Au-delà de ce seuil, les données sont tronquées, ce qui en fait la limite maximale validée pour les applications à long contexte. Pour les requêtes segmentées via l'API, le paramètre max_new_tokens est configuré par défaut à 1 024 tokens audio par segment, tandis que la taille des segments de texte d'entrée est généralement configurée entre 100 et 300 caractères.
Performances et comparaison avec l'état de l'art
Les mesures de performance fournies par le constructeur mettent en avant une grande efficacité technique. Testé sur un GPU NVIDIA H200, Fish Audio S2 Pro affiche un Real-Time Factor (RTF) de 0,195, un délai d'attente avant le premier signal audio (Time to First Audio) d'environ 100 ms, et une vitesse de génération supérieure à 3 000 tokens acoustiques par seconde sous charge. Il convient de noter que ces données proviennent directement du fournisseur et n'ont pas fait l'objet d'un audit indépendant.
Sur le plan de la qualité, le modèle s'illustre sur les benchmarks de référence. Lors des tests Seed-TTS-Eval, le rapport technique revendique les meilleurs taux d'erreur sur les mots (WER) publiés à ce jour pour le chinois (0,54 %) et l'anglais (0,99 %), devançant des solutions telles que CosyVoice 3, Qwen3-TTS, MiniMax Speech-02 et Seed-TTS. Sur le jeu de données de MiniMax, S2 Pro obtient le meilleur WER dans 11 langues sur 24, et la meilleure similarité vocale dans 17 d'entre elles. Néanmoins, Fish Audio reconnaît que des solutions propriétaires comme ElevenLabs ou MiniMax conservent l'avantage sur certaines langues à faibles ressources. De plus, les évaluations concernant le naturel de la voix et le respect des instructions reposent en grande partie sur des juges automatisés par LLM (notamment Gemini 3 Pro), des résultats qui doivent donc être interprétés avec la nuance nécessaire.
Grâce à sa flexibilité et à sa capacité de contrôle émotionnel fin, Fish Audio S2 Pro est particulièrement adapté aux secteurs du doublage de films, de la production de livres audio, de la création de voix pour les personnages de jeux vidéo, ainsi qu'au déploiement d'agents vocaux interactifs et de dialogues multivoix complexes.
Cependant, son déploiement local exige des ressources matérielles conséquentes, Fish Audio recommandant un minimum de 24 Go de mémoire vidéo (VRAM). De plus, les performances restent perfectibles pour les langues moins représentées, et le benchmark propriétaire utilisé pour évaluer l'efficacité des balises en langage naturel manque encore de diversité et de validation humaine approfondie.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Synthèse vocale
Type principal de contenu traité ou produit par ce modèle.
Synthèse vocale
Transforme du texte en parole.
Audio
Traite ou produit de l'audio (voix, musique, effets).
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
Fish Audio S2 Pro
Dernière versionfish-audio/s2-proSynthèse vocaleAudio- Architecture
- 5 milliards de paramètres (4B Slow AR + 400M Fast AR)
- Limite de contexte opérationnelle
- 8 192 tokens
- Langues prises en charge
- Plus de 80 langues (avec détection automatique)
- RTF (Real-Time Factor)
- 0,195 (sur NVIDIA H200)
Tarif annoncé : 15.00 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)