Vidéo

GoogleÉtats-Unis

Gemini Omni

Modèle vidéo-à-vidéo ultra-rapide de Google, ses capacités d'édition, ses limites et sa disponibilité.

Dernière version
Gemini Omni 1.1 Flash
Numéro de version
1.1
Sortie
27 août 2026
Type
Vidéo
Versions recensées
2

Ce que fait ce modèle

Statut et origine de l'identifiant Gemini Omni 1.1 Flash

Au 27 août 2026, l'identifiant précis gemini-omni-1.1-flash se positionne dans une phase de prépublication. Ce modèle n'a pas encore fait l'objet d'une annonce officielle, d'une documentation technique publique ou d'une grille tarifaire de la part de Google. Bien que repéré de manière non officielle dans certaines interfaces de Google Cloud, il convient de le considérer à ce jour comme un identifiant non confirmé. Aucune date de sortie ni aucun journal des modifications (changelog) officiel ne lui sont directement attribués.

Pour analyser son potentiel, il faut se référer à la déclinaison officielle la plus proche : Gemini Omni Flash. Lancé le 19 mai 2026 pour animer des services comme Google Flow et YouTube Shorts, ce modèle a vu son API ouverte en préversion publique le 30 juin 2026 sous le nom de gemini-omni-flash-preview. Google le positionne comme un modèle ultra-rapide spécialisé dans la génération et l'édition vidéo conversationnelle.

Capacités multimodales et fonctionnement de l'API

Gemini Omni Flash s'appuie sur une architecture multimodale asymétrique. En entrée, le modèle prend en charge une grande variété de formats : Le texte L'image fixe La vidéo L'audio

En revanche, sa sortie documentée se concentre exclusivement sur la production de vidéo accompagnée d'une bande-son. Il ne s'agit pas d'un modèle généraliste conçu pour renvoyer du texte brut, des images isolées ou des fichiers audio autonomes. Parmi les cas d'application mis en avant, on retrouve la génération de vidéos avec audio à partir de descriptions textuelles, l'animation d'images fixes, le transfert de mouvement ou de style, et l'édition itérative par instructions textuelles en langage naturel via l'Interactions API. Toutefois, notez que les références audio en entrée ne sont pas encore opérationnelles dans la version actuelle de l'API, malgré l'annonce de leur prise en charge dans la fiche technique du modèle.

Caractéristiques techniques et performances

La fiche technique de la préversion gemini-omni-flash-preview présente des spécifications calibrées pour des flux de travail rapides et interactifs : Fenêtre de contexte : Elle s'élève à 1 048 576 tokens. Capacité de sortie : Le modèle génère des clips courts de 3 à 10 secondes. Format vidéo : Sorties en résolution 720p à 24 images par seconde. Édition de vidéos importées : Le système accepte l'importation de vidéos existantes d'une durée maximale de 10 secondes.

Ces valeurs caractérisent la préversion actuelle et ne préjugent pas des capacités finales de la version 1.1-flash officielle.

Sur le terrain des performances, Google DeepMind revendique d'excellents résultats d'après des évaluations humaines internes. Sur le benchmark MovieGenBench (portant sur 1 003 prompts), le modèle se classe en tête pour la préférence globale et le suivi d'instructions. Sur VBench pour l'évaluation de l'image-vers-vidéo (355 paires), Google annonce une égalité en tête avec Grok Imagine Video et Kling. Ces données, fournies par l'éditeur, n'ont pas encore fait l'objet de publications numériques exhaustives par des tiers indépendants.

Cas d'usage pratiques et limites identifiées

Le modèle excelle dans les scénarios de création rapide et d'itération : Création de maquettes publicitaires et de prévisualisations. Animation d'illustrations et production de clips pour les réseaux sociaux. * Retouche vidéo collaborative par commandes conversationnelles.

Néanmoins, plusieurs limites strictes encadrent son usage. Les utilisateurs peuvent faire face à des difficultés pour maintenir une cohérence parfaite entre les différentes étapes d'édition, pour rendre fidèlement des mouvements physiques complexes ou pour afficher du texte lisible à l'écran. L'API actuelle ne prend pas en charge l'extension de vidéo, l'interpolation d'images (génération d'états entre une première et une dernière image), l'édition de la voix, la gestion multi-vidéo ou les instructions système personnalisées. Des restrictions géographiques s'appliquent également, rendant certaines fonctionnalités indisponibles en Europe, au Royaume-Uni et en Suisse. De plus, toutes les vidéos générées intègrent un marquage invisible via la technologie SynthID.

Alors que les tarifs de l'API publique pour gemini-omni-flash-preview s'élèvent à 1,50 $ par million de tokens d'entrée, 9 $ par million de tokens de sortie texte et 17,50 $ par million de tokens de sortie vidéo (soit environ 0,10 $ par seconde de vidéo 720p), le modèle gemini-omni-1.1-flash affiche une tarification distincte sur notre plateforme.

Le coût d'utilisation de ce modèle est de 30,00 $ par million de tokens en entrée et de 50,00 $ par million de tokens en sortie.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Vidéo

Type principal de contenu traité ou produit par ce modèle.

Vision

Analyse d'images fournies en entrée (photos, captures, documents visuels).

Fichiers

Peut s'appuyer sur des fichiers joints (documents, extraits) en plus du texte.

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Génération vidéo

Produit des séquences vidéo (texte vers vidéo, image vers vidéo, ou avatar).

Audio

Traite ou produit de l'audio (voix, musique, effets).

Historique des versions

2 versions reconstituées à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. 27 août 2026

    Gemini Omni 1.1 Flash

    Dernière version

    google:gemini-omni-1.1-flash

    VisionFichiersOutilsGénération vidéoAudio
    Fenêtre de contexte
    1 048 576 jetons
    Fenêtre de contexte
    1 048 576 tokens
    Résolution de sortie
    720p à 24 i/s
    Durée des clips
    3 à 10 secondes
    Tarif Entrée Plateforme
    30,00 $ / million de tokens
    Tarif Sortie Plateforme
    50,00 $ / million de tokens

    Tarif annoncé : 1.50 $ en entrée, 9.00 $ en sortie, par million de jetons (USD)

  2. Date non communiquée

    Gemini Omni Flash

    google:gemini-omni-flash-preview

    Gemini Omni Flash (gemini-omni-flash-preview), le modèle multimodal de Google conçu pour transformer la création et l'édition vidéo.

    VisionOutilsGénération vidéo
    Identifiant API
    gemini-omni-flash-preview
    Date d'annonce
    19 mai 2026
    Architecture
    Transformer (multimodal natif)
    Entrées supportées
    Texte, images, audio, fichiers vidéo
    Sorties supportées
    Vidéo haute qualité avec audio (images et audio à terme)
    Marquage de sécurité
    SynthID intégré nativement

    Tarif annoncé : 1.50 $ en entrée, 9.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca