Ce que fait ce modèle
Statut et origine de l'identifiant Gemini Omni 1.1 Flash
Au 27 août 2026, l'identifiant précis gemini-omni-1.1-flash se positionne dans une phase de prépublication. Ce modèle n'a pas encore fait l'objet d'une annonce officielle, d'une documentation technique publique ou d'une grille tarifaire de la part de Google. Bien que repéré de manière non officielle dans certaines interfaces de Google Cloud, il convient de le considérer à ce jour comme un identifiant non confirmé. Aucune date de sortie ni aucun journal des modifications (changelog) officiel ne lui sont directement attribués.
Pour analyser son potentiel, il faut se référer à la déclinaison officielle la plus proche : Gemini Omni Flash. Lancé le 19 mai 2026 pour animer des services comme Google Flow et YouTube Shorts, ce modèle a vu son API ouverte en préversion publique le 30 juin 2026 sous le nom de gemini-omni-flash-preview. Google le positionne comme un modèle ultra-rapide spécialisé dans la génération et l'édition vidéo conversationnelle.
Capacités multimodales et fonctionnement de l'API
Gemini Omni Flash s'appuie sur une architecture multimodale asymétrique. En entrée, le modèle prend en charge une grande variété de formats : Le texte L'image fixe La vidéo L'audio
En revanche, sa sortie documentée se concentre exclusivement sur la production de vidéo accompagnée d'une bande-son. Il ne s'agit pas d'un modèle généraliste conçu pour renvoyer du texte brut, des images isolées ou des fichiers audio autonomes. Parmi les cas d'application mis en avant, on retrouve la génération de vidéos avec audio à partir de descriptions textuelles, l'animation d'images fixes, le transfert de mouvement ou de style, et l'édition itérative par instructions textuelles en langage naturel via l'Interactions API. Toutefois, notez que les références audio en entrée ne sont pas encore opérationnelles dans la version actuelle de l'API, malgré l'annonce de leur prise en charge dans la fiche technique du modèle.
Caractéristiques techniques et performances
La fiche technique de la préversion gemini-omni-flash-preview présente des spécifications calibrées pour des flux de travail rapides et interactifs : Fenêtre de contexte : Elle s'élève à 1 048 576 tokens. Capacité de sortie : Le modèle génère des clips courts de 3 à 10 secondes. Format vidéo : Sorties en résolution 720p à 24 images par seconde. Édition de vidéos importées : Le système accepte l'importation de vidéos existantes d'une durée maximale de 10 secondes.
Ces valeurs caractérisent la préversion actuelle et ne préjugent pas des capacités finales de la version 1.1-flash officielle.
Sur le terrain des performances, Google DeepMind revendique d'excellents résultats d'après des évaluations humaines internes. Sur le benchmark MovieGenBench (portant sur 1 003 prompts), le modèle se classe en tête pour la préférence globale et le suivi d'instructions. Sur VBench pour l'évaluation de l'image-vers-vidéo (355 paires), Google annonce une égalité en tête avec Grok Imagine Video et Kling. Ces données, fournies par l'éditeur, n'ont pas encore fait l'objet de publications numériques exhaustives par des tiers indépendants.
Cas d'usage pratiques et limites identifiées
Le modèle excelle dans les scénarios de création rapide et d'itération : Création de maquettes publicitaires et de prévisualisations. Animation d'illustrations et production de clips pour les réseaux sociaux. * Retouche vidéo collaborative par commandes conversationnelles.
Néanmoins, plusieurs limites strictes encadrent son usage. Les utilisateurs peuvent faire face à des difficultés pour maintenir une cohérence parfaite entre les différentes étapes d'édition, pour rendre fidèlement des mouvements physiques complexes ou pour afficher du texte lisible à l'écran. L'API actuelle ne prend pas en charge l'extension de vidéo, l'interpolation d'images (génération d'états entre une première et une dernière image), l'édition de la voix, la gestion multi-vidéo ou les instructions système personnalisées. Des restrictions géographiques s'appliquent également, rendant certaines fonctionnalités indisponibles en Europe, au Royaume-Uni et en Suisse. De plus, toutes les vidéos générées intègrent un marquage invisible via la technologie SynthID.
Alors que les tarifs de l'API publique pour gemini-omni-flash-preview s'élèvent à 1,50 $ par million de tokens d'entrée, 9 $ par million de tokens de sortie texte et 17,50 $ par million de tokens de sortie vidéo (soit environ 0,10 $ par seconde de vidéo 720p), le modèle gemini-omni-1.1-flash affiche une tarification distincte sur notre plateforme.
Le coût d'utilisation de ce modèle est de 30,00 $ par million de tokens en entrée et de 50,00 $ par million de tokens en sortie.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Vidéo
Type principal de contenu traité ou produit par ce modèle.
Vision
Analyse d'images fournies en entrée (photos, captures, documents visuels).
Fichiers
Peut s'appuyer sur des fichiers joints (documents, extraits) en plus du texte.
Outils
Peut appeler des outils ou des fonctions (recherche, calcul, actions).
Génération vidéo
Produit des séquences vidéo (texte vers vidéo, image vers vidéo, ou avatar).
Audio
Traite ou produit de l'audio (voix, musique, effets).
Historique des versions
2 versions reconstituées à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- 27 août 2026
Gemini Omni 1.1 Flash
Dernière versiongoogle:gemini-omni-1.1-flashVisionFichiersOutilsGénération vidéoAudio- Fenêtre de contexte
- 1 048 576 jetons
- Fenêtre de contexte
- 1 048 576 tokens
- Résolution de sortie
- 720p à 24 i/s
- Durée des clips
- 3 à 10 secondes
- Tarif Entrée Plateforme
- 30,00 $ / million de tokens
- Tarif Sortie Plateforme
- 50,00 $ / million de tokens
Tarif annoncé : 1.50 $ en entrée, 9.00 $ en sortie, par million de jetons (USD)
- Date non communiquée
Gemini Omni Flash
google:gemini-omni-flash-previewGemini Omni Flash (gemini-omni-flash-preview), le modèle multimodal de Google conçu pour transformer la création et l'édition vidéo.
VisionOutilsGénération vidéo- Identifiant API
- gemini-omni-flash-preview
- Date d'annonce
- 19 mai 2026
- Architecture
- Transformer (multimodal natif)
- Entrées supportées
- Texte, images, audio, fichiers vidéo
- Sorties supportées
- Vidéo haute qualité avec audio (images et audio à terme)
- Marquage de sécurité
- SynthID intégré nativement
Tarif annoncé : 1.50 $ en entrée, 9.00 $ en sortie, par million de jetons (USD)