Texte

DeepSeek

DeepSeek V4 Flash Vision

Le modèle expérimental DeepSeek V4 Flash Vision Exp, alliant une fenêtre de contexte de 1M de tokens et des capacités d'analyse visuelle à un tarif hautement compétitif.

Dernière version
DeepSeek V4 Flash Vision Exp
Numéro de version
4
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Introduction du modèle et contexte de sortie

Le 21 août 2026, DeepSeek a enrichi sa gamme de modèles avec le lancement de deepseek-v4-flash-vision-exp, disponible immédiatement sur l'API de DeepSeek et sur le catalogue OpenRouter sous l'identifiant deepseek/deepseek-v4-flash-vision-exp. Présenté comme une version expérimentale (« Exp ») basée sur le modèle textuel DeepSeek-V4-Flash-0731, ce nouveau venu intègre une dimension essentielle : la compréhension d'images. Contrairement à d'autres lancements majeurs, la sortie de cette variante n'a pas fait l'objet d'un billet de blog dédié, s'inscrivant plutôt dans une mise à jour directe de la documentation technique et des catalogues d'API.

Modalités, capacités techniques et interfaces

Le modèle se positionne strictement sur l'axe multimodal « texte et image vers texte ». Il accepte des requêtes combinant des invites textuelles et des données visuelles pour restituer exclusivement des réponses sous forme de texte. Il convient de souligner que cette variante n'offre pas de support pour la génération d'images, ni pour l'entrée ou la sortie de formats audio ou vidéo.

L'un des atouts majeurs de cette version réside dans ses fonctionnalités avancées d'interaction et de contrôle : - Raisonnement configurable : Le modèle propose une fonction de raisonnement ajustable. Sur la plateforme OpenRouter, cette option est activée par défaut, permettant de choisir entre trois niveaux d'effort : low, high et max (l'effort par défaut étant configuré sur high). - Appels d'outils (Tool Calls) : Essentiels pour la mise en œuvre d'architectures d'agents autonomes. - Sortie JSON structurée et API Responses : Permettant une intégration transparente dans des pipelines de données complexes. - Compatibilité avec l'API Anthropic : Facilitant la migration ou l'usage croisé pour les développeurs habitués à ces formats d'API.

En revanche, une limitation fonctionnelle claire doit être signalée : la fonction de complétion de code au milieu d'un texte (Fill-in-the-Middle ou FIM), pourtant populaire sur d'autres déclinaisons de DeepSeek, n'est pas prise en charge sur cette variante axée sur la vision.

Contexte étendu et limites de traitement

Pour répondre aux exigences des applications modernes, DeepSeek dote ce modèle d'une fenêtre de contexte de 1 048 576 tokens (soit environ 1 million de tokens). Le volume maximal de sortie est fixé à 384 000 tokens, des plafonds identiques à ceux déclarés par OpenRouter pour son fournisseur principal.

Bien que la documentation de tarification de DeepSeek confirme que les images sont facturées en tokens d'entrée en fonction de leurs dimensions d'affichage, les détails algorithmiques précis (résolution maximale acceptée, nombre d'images simultanées supportées et formule exacte de conversion des pixels en tokens) nécessitent une consultation approfondie du guide d'intégration Vision de l'éditeur lors de la mise en œuvre technique.

Performances et positionnement concurrentiel

Sur le plan des capacités purement textuelles, DeepSeek affirme que ce modèle conserve la vélocité et le niveau de connaissances de la version V4 Flash standard. L'éditeur a partagé plusieurs indicateurs issus de ses propres protocoles d'évaluation (DeepSeek Harness) : - Terminal Bench 2.1 : 83,9 - NL2Repo : 57,7 - DeepSWE : 59,3 - DSBench-Hard : 63,6 - ApexBench : 36,5 - Agents' Last Exam : 27,3 - Chartography : 64,3 - ZeroBench (pass@5) : 35,0

Face au modèle « Opus 4.8 » sur des scénarios d'agents multimodaux, les résultats partagés par DeepSeek dessinent un portrait contrasté. La version expérimentale de DeepSeek prend l'avantage sur des évaluations comme Agents' Last Exam (27,3 contre 25,7) et ZeroBench (35,0 contre 34,0). Toutefois, elle s'incline légèrement sur les bancs d'essai ApexBench (36,5 contre 39,4) et Chartography (64,3 contre 65,0). Il convient de rappeler que ces mesures proviennent de l'éditeur lui-même et n'ont pas fait l'objet d'une validation indépendante.

Cas d'usage concrets et limites opérationnelles

Compte tenu de sa structure tarifaire très basse et de ses capacités d'appel d'outils, ce modèle s'avère particulièrement pertinent pour : 1. Les boucles d'agents logiciels : Capables d'analyser en temps réel des captures d'écran ou des interfaces utilisateur pour en déduire des actions de navigation et de planification. 2. L'assistance au développement à partir de maquettes : Permettant de transformer une capture d'écran d'interface en code ou en spécifications techniques. 3. L'analyse de graphiques et de rapports : Pour l'extraction et l'interprétation rapide de données quantitatives présentées visuellement.

Limites importantes : Son statut expérimental implique l'absence de documentation publique exhaustive concernant l'architecture interne du réseau, le volume de données d'entraînement, ainsi que la date de coupure des connaissances (knowledge cutoff). De plus, l'absence de support natif pour les documents de type PDF (non convertis au préalable en images) ou pour les flux vidéo restreint son utilisation directe à des fichiers strictement de type image. Pour des processus de production critiques (OCR de haute précision, traitement de textes fins d'interface, données financières), une phase d'évaluation rigoureuse sur des jeux de tests internes s'avère indispensable.

Le modèle présente une grille tarifaire extrêmement agressive de la part de DeepSeek : 0,22 $ par million de tokens en entrée (sans cache), 0,007 $ en lecture de cache et 0,66 $ par million de tokens en sortie. Notez que l'API officielle de DeepSeek double ces tarifs lors des heures de pointe (01:00–04:00 et 06:00–10:00 UTC), avec une limite de concurrence fixée à 2 500.

Sur OpenRouter, les tarifs de base hors pointe s'alignent actuellement sur ceux du fournisseur principal (0,22 $ / M tokens en entrée, 0,66 $ / M tokens en sortie), bien que ces prix soient susceptibles d'évoluer.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Vision

Analyse d'images fournies en entrée (photos, captures, documents visuels).

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    DeepSeek V4 Flash Vision Exp

    Dernière version

    deepseek/deepseek-v4-flash-vision-exp

    VisionOutils
    Fenêtre de contexte
    1 048 576 tokens
    Plafond de sortie
    384 000 tokens
    Tarif Entrée (hors pointe)
    0,22 $ / million de tokens
    Tarif Sortie (hors pointe)
    0,66 $ / million de tokens
    Raisonnement
    Configurable (low, high, max)

    Tarif annoncé : 0.22 $ en entrée, 0.66 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca