Image

Black Forest Labs

FLUX

Le modèle multimodal de Black Forest Labs associant génération vidéo HD et audio natif, bientôt disponible sur OpenRouter.

Dernière version
FLUX.2 [pro] de
Type
Image
Versions recensées
7

Ce que fait ce modèle

Introduction et genèse du modèle

Le 23 juillet 2026, Black Forest Labs (BFL) a marqué un tournant dans le domaine de l'intelligence artificielle générative en présentant FLUX 3 en accès anticipé. Conçu comme une fondation multimodale entraînée conjointement sur des données d'images, de vidéo et d'audio, ce modèle franchit une étape décisive par rapport aux architectures traditionnelles d'image seule. Quelques jours plus tard, le 4 août 2026, la variante spécifique FLUX 3 Video est devenue accessible en disponibilité générale via l'API de BFL ainsi que chez des partenaires sélectionnés. Ce modèle se distingue par sa capacité à fusionner la génération visuelle et sonore au sein d'un flux de travail unifié.

Capacités et modalités : Une intégration native de l'audio

FLUX 3 Video est avant tout un modèle de génération de texte et d'image vers vidéo. Sa principale innovation réside dans la gestion native de l'audio. Contrairement aux approches qui superposent une piste sonore générée a posteriori, FLUX 3 Video conçoit les éléments visuels et auditifs de manière synchrone. Il est ainsi capable de générer des paroles multilingues avec une synchronisation labiale précise, des effets sonores réalistes et une ambiance acoustique adaptée à la scène visuelle.

Le modèle accepte une grande variété d'entrées pour guider la création : - Des invites textuelles (prompts) décrivant la scène. - Une image de départ ou de référence pour fixer le style ou le sujet. - Des images-clés définissant le début, la fin ou plusieurs jalons de la séquence. - Une vidéo existante accompagnée de son audio pour réaliser des prolongations (le modèle pouvant étendre jusqu'à quatre secondes de contenu source).

De plus, FLUX 3 Video gère nativement les changements de plans et les mouvements de caméra complexes au sein d'un même clip, tout en assurant une intégration typographique soignée directement dans la scène tridimensionnelle. Bien que l'architecture globale de FLUX 3 englobe également la génération d'images fixes et la prédiction d'actions robotiques, la variante FLUX 3 Video se concentre exclusivement sur la production vidéo et sonore ; elle ne doit pas être confondue avec un modèle de langage conversationnel ou de raisonnement textuel.

Spécifications techniques et limites de contexte

À l'heure actuelle, Black Forest Labs maintient une certaine confidentialité sur les détails structurels de son modèle. Le nombre de paramètres, la taille de la fenêtre de contexte en tokens ainsi que les limites de longueur pour les invites textuelles ou les images de référence ne sont pas rendus publics.

Cependant, les contraintes opérationnelles de sortie sont clairement définies : - La durée maximale d'une seule génération est de 20 secondes. - Les résolutions prises en charge sont le 720p (HD) et le 1080p (Full HD, ce dernier s'appuyant sur un procédé d'upscaling mentionné par le constructeur). - Les démonstrations d'évaluation initiales se concentraient sur des clips de 10 secondes en 720p avec audio. - Pour obtenir des séquences plus longues, les utilisateurs doivent enchaîner plusieurs clips successifs, la continuité au-delà de 20 secondes n'étant pas nativement gérée en une seule passe.

Positionnement concurrentiel et performances

Les données de performance disponibles proviennent exclusivement des évaluations internes menées par Black Forest Labs et doivent être considérées comme préliminaires. Lors de l'annonce du 23 juillet, FLUX 3 affichait des taux de préférence humaine particulièrement élevés face à ses concurrents : - Préféré à Runway Gen-4.5 dans 77 % des cas. - Préféré à Luma Ray 3.2 dans 93 % des cas. - Des résultats plus serrés face à Seedance 2.0 et Gemini Omni Flash, avec un taux de préférence de 52 %.

Le communiqué du 4 août 2026 a réaffirmé cette progression, plaçant FLUX 3 en tête des évaluations internes pour la génération de texte vers vidéo, et à égalité avec Seedance 2.0 pour la génération d'image vers vidéo, tout en devançant les autres solutions du marché. Il convient toutefois de souligner que ces chiffres ne s'appuient pas sur un benchmark indépendant et reproductible, les protocoles complets, les jeux de prompts et les intervalles d'incertitude n'ayant pas été publiés.

Cas d'usage, limites pratiques et sécurité

FLUX 3 Video s'adresse à un large éventail d'applications professionnelles : - Création de contenu et publicité : Génération rapide de spots et de visuels animés. - Cinéma et prévisualisation : Élaboration de storyboards dynamiques et de maquettes de scènes (previz). - Animation et typographie : Création de titres animés intégrés aux scènes. - Éducation et documentaire : Production de vidéos explicatives ou de courts documentaires enrichis d'audio natif. - Commerce en ligne : Applications de type "virtual try-on" (essayage virtuel).

Malgré ces opportunités, le modèle présente les limites inhérentes à une première version majeure : la durée des clips reste courte, et les outils de contrôle multimodal avancés sont encore en cours de développement. De plus, la qualité finale demeure fortement dépendante de la précision des prompts et des images de référence fournies. Sur le plan éthique et de la sécurité, Black Forest Labs indique avoir collaboré avec l'organisation Cinder pour évaluer et atténuer les risques liés aux contenus intimes non consentis (NCII) et aux abus sur mineurs (CSAM) avant le déploiement.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Image

Type principal de contenu traité ou produit par ce modèle.

Vision

Analyse d'images fournies en entrée (photos, captures, documents visuels).

Génération vidéo

Produit des séquences vidéo (texte vers vidéo, image vers vidéo, ou avatar).

Fichiers

Peut s'appuyer sur des fichiers joints (documents, extraits) en plus du texte.

Audio

Traite ou produit de l'audio (voix, musique, effets).

Génération d'images

Produit des images à partir d'une consigne textuelle ou d'une image source.

Historique des versions

7 versions reconstituées à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    FLUX.2 [pro] de

    Dernière version

    black-forest-labs/flux.2-pro

    FLUX.2 [pro], le modèle de génération et d'édition d'images de Black Forest Labs, alliant haute fidélité visuelle et coûts maîtrisés.

    VisionGénération d'images
    Fenêtre de contexte
    47 000 tokens
    Résolution maximale
    4 Mégapixels (limite API de 9 MP entrée + sortie)
    Score Elo Image Arena
    1185,42 (13e sur 79)
    Tarif de base (Sortie)
    0,03 $ / MP
  2. Date non communiquée

    FLUX.2 [max] de

    black-forest-labs/flux.2-max

    FLUX.2 [max], le modèle d'image d'élite de Black Forest Labs disponible sur OpenRouter, alliant photoréalisme extrême et recherche web intégrée.

    VisionGénération d'images
    Éditeur
    Black Forest Labs
    Date de sortie
    16 décembre 2025
    Résolution maximale
    4 Mégapixels (MP)
    Fenêtre de contexte (OpenRouter)
    46 864 tokens
    Tarif de base
    0,07 $ / MP
  3. Date non communiquée

    FLUX.2 [klein] 4B

    black-forest-labs/flux.2-klein-4b

    Le modèle d'image de Black Forest Labs conçu pour l'inférence locale sous la seconde et l'édition multi-référence.

    VisionGénération d'images
    Nombre de paramètres
    4 milliards
    Fenêtre de contexte
    41K tokens
    Résolution maximale d'édition
    4 MP
    Licence
    Apache 2.0
  4. Date non communiquée

    FLUX.2 Flex

    black-forest-labs/flux.2-flex

    Modèle de génération d'images et de vision développé par Black Forest Labs, disponible gratuitement sur OpenRouter pour des créations visuelles flexibles.

    VisionGénération d'images
    Concepteur
    Black Forest Labs
    Fournisseur API
    OpenRouter
    Capacités
    Génération d'images, Vision
    Coût d'entrée
    0,00 $
    Coût de sortie
    0,00 $

    Tarif annoncé : 0.00 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)

  5. Date non communiquée

    FLUX Video Upscale

    black-forest-labs/flux-video-upscale

    Le nouvel outil de Black Forest Labs conçu pour sublimer les vidéos génératives jusqu'en 4K avec fidélité ou créativité.

    Génération vidéo
    Facteurs d'échelle
    1,5×, 2×, 3×
    Résolution de sortie maximale
    Environ 14,4 mégapixels par image
    Durée maximale de traitement
    20 secondes
    Modes de fonctionnement
    Precise (4 étapes, 0,07 $/MP/s) et Creative (8 étapes, 0,10 $/MP/s)
    Formats pris en charge
    MP4, WebM, MOV
  6. Date non communiquée

    FLUX Video Edit

    black-forest-labs/flux-video-edit

    Black Forest Labs lance FLUX Video Edit, un outil spécialisé dans la retouche vidéo précise par instruction textuelle, désormais répertorié sur OpenRouter.

    VisionFichiersGénération vidéoAudio
    Type d'entrée
    Vidéo MP4 (URL ou base64) + texte (1 à 4 096 caractères)
    Format de sortie
    Vidéo MP4 normalisée à 24 fps, max 720p
    Durée maximale d'entrée
    15 secondes (taille max. 50 MiB)
    Temps de traitement moyen
    ~50 s pour 10 s de vidéo (BFL) / 40,35 s de latence médiane (OpenRouter)
    Tarif officiel constructeur
    0,03 USD par seconde de vidéo générée (0,30 USD pour 10 s)

    Tarif annoncé : 0.00 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)

  7. Date non communiquée

    FLUX 3 Video

    black-forest-labs/flux-3-video

    VisionGénération vidéo
    Résolution maximale
    1080p (Full HD avec upscale)
    Durée maximale par clip
    20 secondes
    Entrées supportées
    Texte, Image, Images-clés, Vidéo source
    Audio natif
    Oui (paroles, effets sonores, ambiance)
    Fenêtre de contexte
    Inconnue

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca