Ce que fait ce modèle
Décryptage de Google Lyria 3.5 : La nouvelle frontière de la génération musicale par IA
## Présentation générale et proposition de valeur Le domaine de l'intelligence artificielle générative franchit une étape décisive avec l'introduction de Lyria 3.5, le tout dernier modèle de génération musicale développé par Google. Conçu exclusivement pour la création sonore, Lyria 3.5 ne s'inscrit pas dans la lignée des modèles linguistiques généralistes ou de raisonnement, mais s'impose comme un outil hautement spécialisé. Son déploiement s'est articulé en deux phases distinctes au cours de l'année 2026. Tout d'abord, Google a annoncé son intégration au sein de Google Flow Music le 29 juillet 2026, en mettant en avant des avancées majeures en matière de musicalité, de gestion des paroles, de réalisme vocal et de contrôle créatif. Par la suite, le 3 septembre 2026, le modèle a été rendu accessible au public en version préliminaire (public preview) au sein de la Gemini API sous l'identifiant générique lyria-3.5, accompagné de deux déclinaisons techniques : lyria-3.5-clip-preview et lyria-3.5-pro-preview.
## Architecture technique et modalités d'entrée/sortie Sur le plan architectural, la carte de modèle publiée par Google DeepMind décrit Lyria 3.5 comme un système de diffusion latente appliqué à des représentations audio temporelles. Cette approche lui permet de sculpter le signal sonore de manière à préserver la cohérence temporelle et la fidélité acoustique.
L'un des aspects les plus remarquables de cette version réside dans sa nature multi-modale en entrée. Bien que la fiche technique initiale de DeepMind ne mentionne que le texte comme modalité d'entrée, la documentation officielle de la Gemini API confirme que le modèle accepte à la fois du texte et des images. Une image peut ainsi être soumise au modèle pour servir de référence d'ambiance ou d'inspiration esthétique, que l'IA traduit ensuite en textures musicales.
En sortie, Lyria 3.5 génère un fichier audio au format MP3 stéréo de qualité professionnelle, échantillonné à 44,1 kHz. En complément du flux audio, le modèle fournit le texte des paroles générées ainsi qu'une description ou une structuration de la chanson, selon l'interface de programmation utilisée.
## Une gamme segmentée : Clip versus Pro Pour répondre aux différents besoins de production, la famille Lyria 3.5 se scinde en deux variantes optimisées selon la durée du livrable : - Lyria 3.5 Clip (lyria-3.5-clip-preview) : Cette variante génère systématiquement des extraits d'une durée stricte de 30 secondes. Elle est particulièrement recommandée par Google pour le prototypage rapide, la création de boucles musicales, la réalisation de maquettes ou l'expérimentation de prompts. - Lyria 3.5 Pro (lyria-3.5-pro-preview) : Destinée à la production de morceaux complets de "quelques minutes", cette version intègre une structure narrative complexe comprenant des couplets, des refrains et des ponts. L'utilisateur peut influencer la durée du morceau par le biais de ses instructions textuelles ou en définissant des horodatages précis. Dans le cadre de Flow Music, la durée maximale évoquée par DeepMind atteint trois minutes.
Les deux variantes partagent une fenêtre de contexte d'entrée particulièrement large de 131 072 jetons. Google n'ayant pas publié de limite stricte pour les jetons de sortie, la contrainte opérationnelle majeure reste dictée par la durée physique du fichier audio généré.
## Capacités musicales et contrôle créatif Lyria 3.5 offre un éventail étendu de contrôles pour les créateurs. Les utilisateurs peuvent spécifier le genre musical, l'instrumentation, le tempo (exprimé en BPM), la tonalité, le niveau d'énergie globale et la forme structurelle de l'œuvre. Les voix chantées bénéficient d'une expressivité accrue et d'une prononciation affinée.
La gestion des paroles est elle aussi très flexible. Le modèle génère automatiquement des paroles dans la langue utilisée dans le prompt. Toutefois, l'utilisateur a la possibilité de fournir ses propres textes et de guider la structure du morceau en insérant des balises sémantiques standardisées telles que [Verse], [Chorus] ou [Bridge]. Pour optimiser les résultats, Google conseille d'adopter une approche méthodique : valider d'abord l'orientation artistique avec la version Clip avant de lancer la génération complète avec la version Pro, tout en décrivant précisément l'atmosphère et les instruments souhaités.
## Positionnement concurrentiel et évaluations En interne, Google revendique une amélioration significative par rapport à la génération précédente, Lyria 2, notamment en ce qui concerne la fidélité audio brute et le respect des consignes complexes (adhérence au prompt), même lorsque celles-ci incluent des contraintes textuelles et des paroles spécifiques.
L'évaluation de ces performances repose sur un protocole hybride associant des tests automatisés et des panels d'évaluation humains. Les critères mesurés englobent l'esthétique musicale, la qualité des voix, la fidélité de restitution et le suivi des instructions. Néanmoins, à l'heure actuelle, Google ne fournit aucun score chiffré, aucun détail méthodologique approfondi, ni aucune comparaison directe avec les leaders actuels du marché de la musique générative tels que Suno ou Udio. Par conséquent, son positionnement quantitatif exact face à la concurrence demeure inconnu.
## Limites techniques, sécurité et éthique Le modèle présente des restrictions importantes que les développeurs doivent prendre en compte : - Absence d'édition multi-tour : Il est impossible de modifier ou d'éditer par étapes un morceau déjà généré. - Non-déterminisme : Soumettre le même prompt plusieurs fois produira des résultats différents à chaque exécution. - Absence de fonctionnalités avancées de la suite Gemini : Lyria 3.5 ne prend en charge ni le raisonnement complexe (thinking), ni la recherche web, ni les appels de fonctions (function calling), ni le cache contextuel, ni la Live API. Il ne peut pas non plus générer d'images. - Filtres de sécurité : Toute requête visant à imiter la voix d'un artiste célèbre ou à reproduire des paroles protégées par le droit d'auteur est systématiquement bloquée. - Traçabilité : Afin de garantir une utilisation responsable, tous les fichiers audio générés intègrent SynthID, une technologie de filigrane inaudible développée par Google pour identifier les contenus créés par IA.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Musique
Type principal de contenu traité ou produit par ce modèle.
Vision
Analyse d'images fournies en entrée (photos, captures, documents visuels).
Audio
Traite ou produit de l'audio (voix, musique, effets).
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
Lyria 3.5
Dernière versiongoogle:lyria-3.5VisionAudio- Fenêtre de contexte
- 131 072 jetons
- Fenêtre de contexte
- 131 072 jetons (entrée)
- Qualité audio
- Stéréo 44,1 kHz (MP3)
- Format des variantes
- Clip (30s) & Pro (jusqu'à 3 min)
- Tarification API d'origine
- 0,08 $ par chanson complète
Tarif annoncé : 0.08 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)