Synthèse vocale

Fish Audio

S2.1 Pro Free:free

Un modèle de synthèse vocale de pointe offrant clonage de voix, contrôle par balises émotionnelles et performances optimales.

Dernière version
Fish Audio S2.1 Pro Free
Type
Synthèse vocale
Versions recensées
1

Ce que fait ce modèle

Une rupture technologique et tarifaire dans la synthèse vocale

Le domaine de la synthèse vocale (Text-to-Speech ou TTS) connaît une accélération remarquable avec l'introduction de solutions de plus en plus fluides et accessibles. Le modèle Fish Audio S2.1 Pro Free (fish-audio/s2.1-pro-free:free) s'inscrit directement dans cette dynamique. Annoncé le 23 juin 2026 par l'éditeur Fish Audio, ce modèle correspond à la variante gratuite de développement de leur système phare, S2.1 Pro.

Cette gratuité temporaire, initialement lancée dans un contexte d'optimisation d'infrastructure, a été prolongée jusqu'au 31 août 2026 sous réserve d'un usage raisonnable. Pour parvenir à proposer un tel modèle sans coût de licence, Fish Audio a massivement optimisé son pipeline d'inférence. L'intégration de noyaux CUDA dédiés, la quantification au format FP8 et l'implémentation du batching continu ont permis de réduire drastiquement les coûts de calcul, rendant cette offre de développement viable pour les créateurs et les entreprises.

Des capacités avancées de génération et de clonage

S2.1 Pro Free est un modèle strictement dédié à la modalité texte-vers-audio. Il reçoit du texte brut et génère une parole réaliste, exportable dans des formats standards tels que le MP3, le WAV/PCM ou l'Opus.

Ses principales fonctionnalités incluent : - Un support multilingue étendu : Le modèle prend en charge 83 langues et intègre un système de détection automatique de la langue source. - Le streaming à faible latence : Essentiel pour les interactions en temps réel. - Le clonage vocal : Il est possible de cloner une voix de manière instantanée à partir d'un ou plusieurs extraits audio de référence, ou de créer un modèle de voix persistant. - Le contrôle stylistique en langage naturel : Contrairement aux systèmes TTS traditionnels qui nécessitent des curseurs complexes, S2.1 Pro Free interprète des instructions paralinguistiques directement insérées dans le texte sous forme de balises entre crochets, comme [whispers sweetly] (chuchote doucement) ou [laughing nervously] (rit nerveusement).

Il convient de préciser les limites applicatives de ce modèle : il ne s'agit pas d'un grand modèle de langage (LLM) conversationnel, ni d'un outil de vision, de raisonnement, de génération d'images ou de transcription. De plus, bien que la famille S2.1 évoque le dialogue multi-locuteurs, la documentation de l'API précise que cette fonctionnalité spécifique est réservée au modèle payant S2-Pro et n'est pas disponible sur la version S2.1 Pro Free.

Gestion du contexte et limites techniques

Fish Audio ne publie pas de dimensionnement de « fenêtre de contexte » exprimé en tokens de texte pour ce modèle. À la place, l'API fonctionne par segmentation.

Le texte d'entrée est découpé en segments d'une longueur définie par le paramètre chunk_length, qui varie de 100 à 300 caractères (avec une valeur par défaut fixée à 300). Une option de continuité vocale permet d'assurer la fluidité de la transition d'un segment à l'autre. En sortie, la limite de génération est fixée par défaut à 1 024 tokens audio par segment (via le paramètre max_new_tokens). Cette segmentation n'empêche pas la génération de contenus longs, comme des livres audio, qui doivent simplement être traités par lots de segments successifs.

Performances revendiquées et positionnement concurrentiel

Sur le plan des performances, Fish Audio affiche des mesures internes particulièrement compétitives : - Une latence de 70 à 90 millisecondes jusqu'à la réception du premier octet audio (Time to First Audio ou TTFT), selon le chemin d'accès API utilisé. - Un débit supérieur à 8 000 tokens audio par seconde lors de requêtes concurrentes (mesuré à 64 requêtes simultanées sur GPU NVIDIA H200). - Un débit sous charge plus de deux fois supérieur à celui de la génération précédente, S2 Pro.

Lors de tests d'écoute comparatifs menés par l'éditeur, S2.1 Pro a obtenu un taux de préférence de 61 % face à S2 Pro. De plus, un benchmark basé sur 5 098 comparaisons A/B sur du trafic web a montré que S2 Pro devançait ElevenLabs V3 avec un taux de victoire de 60 % contre 40 % dans leur face-à-face direct. Il convient toutefois de traiter ces chiffres avec la prudence de rigueur : ces évaluations ont été réalisées par Fish Audio lui-même, excluent les utilisateurs de l'API et comportent des biais potentiels liés au routage ou à la familiarité des évaluateurs avec la plateforme.

Cas d'usage, limites et tarification

Le modèle S2.1 Pro Free est particulièrement recommandé pour plusieurs scénarios : - Le prototypage rapide d'applications audio. - Le développement d'agents vocaux conversationnels en temps réel. - La narration de contenus et la création de livres audio. - Le doublage et la localisation linguistique de vidéos. - La création de voix de personnages pour le jeu vidéo ou le divertissement.

Cependant, la gratuité s'accompagne de contreparties importantes. Fish Audio n'offre aucune garantie de latence, de disponibilité de service (SLA) ou d'accord de traitement des données (DPA). L'éditeur se réserve également le droit de conserver les requêtes soumises afin d'améliorer ses modèles. Enfin, des restrictions commerciales s'appliquent, notamment pour les entreprises dépassant 1 million de dollars de revenus annuels récurrents (ARR).

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Synthèse vocale

Type principal de contenu traité ou produit par ce modèle.

Synthèse vocale

Transforme du texte en parole.

Audio

Traite ou produit de l'audio (voix, musique, effets).

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Fish Audio S2.1 Pro Free

    Dernière version

    fish-audio/s2.1-pro-free:free

    Synthèse vocaleAudio
    Type de modèle
    Synthèse vocale (Text-to-Speech)
    Langues prises en charge
    83 langues avec détection automatique
    Segmentation du texte
    100 à 300 caractères (par défaut 300)
    Limite par segment
    1 024 tokens audio (max_new_tokens)
    Latence (TTFT)
    70 à 90 ms
    Tarif OpenRouter
    0 $ / million de tokens

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca