Ce que fait ce modèle
Introduction du modèle et contexte de sortie
Le 21 août 2026, DeepSeek a enrichi sa gamme de modèles avec le lancement de deepseek-v4-flash-vision-exp, disponible immédiatement sur l'API de DeepSeek et sur le catalogue OpenRouter sous l'identifiant deepseek/deepseek-v4-flash-vision-exp. Présenté comme une version expérimentale (« Exp ») basée sur le modèle textuel DeepSeek-V4-Flash-0731, ce nouveau venu intègre une dimension essentielle : la compréhension d'images. Contrairement à d'autres lancements majeurs, la sortie de cette variante n'a pas fait l'objet d'un billet de blog dédié, s'inscrivant plutôt dans une mise à jour directe de la documentation technique et des catalogues d'API.
Modalités, capacités techniques et interfaces
Le modèle se positionne strictement sur l'axe multimodal « texte et image vers texte ». Il accepte des requêtes combinant des invites textuelles et des données visuelles pour restituer exclusivement des réponses sous forme de texte. Il convient de souligner que cette variante n'offre pas de support pour la génération d'images, ni pour l'entrée ou la sortie de formats audio ou vidéo.
L'un des atouts majeurs de cette version réside dans ses fonctionnalités avancées d'interaction et de contrôle : - Raisonnement configurable : Le modèle propose une fonction de raisonnement ajustable. Sur la plateforme OpenRouter, cette option est activée par défaut, permettant de choisir entre trois niveaux d'effort : low, high et max (l'effort par défaut étant configuré sur high). - Appels d'outils (Tool Calls) : Essentiels pour la mise en œuvre d'architectures d'agents autonomes. - Sortie JSON structurée et API Responses : Permettant une intégration transparente dans des pipelines de données complexes. - Compatibilité avec l'API Anthropic : Facilitant la migration ou l'usage croisé pour les développeurs habitués à ces formats d'API.
En revanche, une limitation fonctionnelle claire doit être signalée : la fonction de complétion de code au milieu d'un texte (Fill-in-the-Middle ou FIM), pourtant populaire sur d'autres déclinaisons de DeepSeek, n'est pas prise en charge sur cette variante axée sur la vision.
Contexte étendu et limites de traitement
Pour répondre aux exigences des applications modernes, DeepSeek dote ce modèle d'une fenêtre de contexte de 1 048 576 tokens (soit environ 1 million de tokens). Le volume maximal de sortie est fixé à 384 000 tokens, des plafonds identiques à ceux déclarés par OpenRouter pour son fournisseur principal.
Bien que la documentation de tarification de DeepSeek confirme que les images sont facturées en tokens d'entrée en fonction de leurs dimensions d'affichage, les détails algorithmiques précis (résolution maximale acceptée, nombre d'images simultanées supportées et formule exacte de conversion des pixels en tokens) nécessitent une consultation approfondie du guide d'intégration Vision de l'éditeur lors de la mise en œuvre technique.
Performances et positionnement concurrentiel
Sur le plan des capacités purement textuelles, DeepSeek affirme que ce modèle conserve la vélocité et le niveau de connaissances de la version V4 Flash standard. L'éditeur a partagé plusieurs indicateurs issus de ses propres protocoles d'évaluation (DeepSeek Harness) : - Terminal Bench 2.1 : 83,9 - NL2Repo : 57,7 - DeepSWE : 59,3 - DSBench-Hard : 63,6 - ApexBench : 36,5 - Agents' Last Exam : 27,3 - Chartography : 64,3 - ZeroBench (pass@5) : 35,0
Face au modèle « Opus 4.8 » sur des scénarios d'agents multimodaux, les résultats partagés par DeepSeek dessinent un portrait contrasté. La version expérimentale de DeepSeek prend l'avantage sur des évaluations comme Agents' Last Exam (27,3 contre 25,7) et ZeroBench (35,0 contre 34,0). Toutefois, elle s'incline légèrement sur les bancs d'essai ApexBench (36,5 contre 39,4) et Chartography (64,3 contre 65,0). Il convient de rappeler que ces mesures proviennent de l'éditeur lui-même et n'ont pas fait l'objet d'une validation indépendante.
Cas d'usage concrets et limites opérationnelles
Compte tenu de sa structure tarifaire très basse et de ses capacités d'appel d'outils, ce modèle s'avère particulièrement pertinent pour : 1. Les boucles d'agents logiciels : Capables d'analyser en temps réel des captures d'écran ou des interfaces utilisateur pour en déduire des actions de navigation et de planification. 2. L'assistance au développement à partir de maquettes : Permettant de transformer une capture d'écran d'interface en code ou en spécifications techniques. 3. L'analyse de graphiques et de rapports : Pour l'extraction et l'interprétation rapide de données quantitatives présentées visuellement.
Limites importantes : Son statut expérimental implique l'absence de documentation publique exhaustive concernant l'architecture interne du réseau, le volume de données d'entraînement, ainsi que la date de coupure des connaissances (knowledge cutoff). De plus, l'absence de support natif pour les documents de type PDF (non convertis au préalable en images) ou pour les flux vidéo restreint son utilisation directe à des fichiers strictement de type image. Pour des processus de production critiques (OCR de haute précision, traitement de textes fins d'interface, données financières), une phase d'évaluation rigoureuse sur des jeux de tests internes s'avère indispensable.
Le modèle présente une grille tarifaire extrêmement agressive de la part de DeepSeek : 0,22 $ par million de tokens en entrée (sans cache), 0,007 $ en lecture de cache et 0,66 $ par million de tokens en sortie. Notez que l'API officielle de DeepSeek double ces tarifs lors des heures de pointe (01:00–04:00 et 06:00–10:00 UTC), avec une limite de concurrence fixée à 2 500.
Sur OpenRouter, les tarifs de base hors pointe s'alignent actuellement sur ceux du fournisseur principal (0,22 $ / M tokens en entrée, 0,66 $ / M tokens en sortie), bien que ces prix soient susceptibles d'évoluer.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Texte
Type principal de contenu traité ou produit par ce modèle.
Vision
Analyse d'images fournies en entrée (photos, captures, documents visuels).
Outils
Peut appeler des outils ou des fonctions (recherche, calcul, actions).
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
DeepSeek V4 Flash Vision Exp
Dernière versiondeepseek/deepseek-v4-flash-vision-expVisionOutils- Fenêtre de contexte
- 1 048 576 tokens
- Plafond de sortie
- 384 000 tokens
- Tarif Entrée (hors pointe)
- 0,22 $ / million de tokens
- Tarif Sortie (hors pointe)
- 0,66 $ / million de tokens
- Raisonnement
- Configurable (low, high, max)
Tarif annoncé : 0.22 $ en entrée, 0.66 $ en sortie, par million de jetons (USD)