Ce que fait ce modèle
Présentation du modèle et statut du cycle de vie
Accessible via le catalogue OpenRouter sous l'identifiant deepseek/deepseek-v4-flash-vision-exp:batch, cette déclinaison correspond à l'offre en traitement différé (batch) du modèle expérimental DeepSeek-V4-Flash-Vision-Exp. Dévoilé initialement le 21 août 2026, ce modèle a été conçu par DeepSeek comme une extension directe de DeepSeek-V4-Flash-0731, venant adjoindre des encodeurs visuels et un entraînement continu spécifique pour doter l'architecture de capacités avancées de compréhension d'images.
Un point d'attention capital concerne le statut opérationnel de cette référence. Le 10 septembre 2026, DeepSeek a officialisé le retrait de V4 Flash et de V4 Flash Vision Exp de sa propre infrastructure d'API directe, redirigeant les requêtes natives vers son successeur, DeepSeek-V4.1-Flash. Toutefois, OpenRouter maintient ce SKU batch actif au catalogue, servi par le fournisseur Fireworks. Pour les équipes d'ingénierie logicielle, une vigilance méthodologique s'impose : la documentation publique ne permet pas de garantir formellement si chaque requête routée en batch applique strictement le checkpoint historique figé ou une redirection d'infrastructure sous-jacente.
Capacités techniques, modalités et gestion des images
Sur le plan des entrées et sorties, le modèle fonctionne selon une modalité mixte en réception (texte et image) et génère exclusivement du texte. Aucune capacité d'ingestion ou d'émission audio ou vidéo n'est documentée, tout comme la génération visuelle demeure absente de ce SKU.
DeepSeek-V4-Flash-Vision-Exp prend en charge les fonctionnalités avancées d'orchestration logicielle, notamment l'appel d'outils et de fonctions externes (tools, tool_choice), ainsi que la production de réponses structurées via des schémas JSON stricts. Du point de vue de l'ingestion visuelle, l'architecture accepte les formats standards (JPEG, PNG, GIF et WebP), transmis via une chaîne Base64, une URL externe accessible ou le biais de l'API Files. Sur le plan de l'évaluation volumétrique, chaque document visuel traité est tokenisé jusqu'à un plafond de 384 tokens pour la comptabilisation et la facturation.
Fenêtre de contexte et conditions tarifaires en mode batch
L'un des atouts de cette référence réside dans l'étendue de sa fenêtre de contexte, portée à 1 048 576 tokens (1 M). Cette capacité d'ingestion permet de charger simultanément des ensembles documentaires denses, de longues séquences d'échanges et des captures d'écran complexes.
Servi via l'infrastructure batch de Fireworks sur OpenRouter, le modèle bénéficie d'une tarification particulièrement agressive, propre aux traitements asynchrones : - Tokens d'entrée : 0,11 $ par million de tokens. - Tokens de sortie : 0,33 $ par million de tokens. - Tokens lus depuis le cache : 0,0035 $ par million de tokens.
Il convient de noter que si le successeur V4.1 Flash propose une limite de génération maximale documentée à 384 000 tokens, la documentation d'OpenRouter ne publie aucune métrique maximale de sortie spécifique à ce SKU historique précis. Ce paramètre reste donc formellement indéterminé pour cette version.
Positionnement face aux modèles existants et benchmarks
Selon les évaluations publiées par le concepteur, Vision Exp préserve une parité quasi totale avec son homologue purement textuel V4-Flash-0731 sur les flux de travail agentiques, tout en débloquant des gains substantiels dès lors que la modalité visuelle entre en jeu.
Sur les benchmarks mesurés par DeepSeek via son infrastructure interne (DeepSeek Harness) et documentés sur Hugging Face, le modèle affiche les scores suivants : - Tâches logicielles et agentiques : 83,9 sur Terminal Bench 2.1, 59,3 sur DeepSWE, et 75,9 sur Toolathlon-Verified. - Raisonnement visuel et multimodal : 36,5 sur ApexBench, 27,3 sur Agents' Last Exam, 64,3 sur Chartography, et 35,0 sur ZeroBench (Pass@5).
À l'époque de sa publication, DeepSeek positionnait les aptitudes agentiques multimodales de Vision Exp à proximité directe d'un modèle de référence comme Opus-4.8. À titre d'exemple, le modèle affichait 36,5 contre 39,4 pour Opus-4.8 sur ApexBench, et 64,3 contre 65,0 sur Chartography. Il importe toutefois de rappeler que ces résultats constituent des mesures constructeur et n'ont pas fait l'objet d'audits comparatifs tiers entièrement indépendants.
Cas d'usage recommandés et limites d'exploitation
Grâce à son couplage entre traitement d'images, appel d'outils et tarification batch réduite, le modèle trouve sa pertinence dans les scénarios de traitement différé en volume : - Extraction de données structurées et indexation à partir de documents scannés, rapports financiers et graphiques d'entreprise. - Analyse post-mortem et audit de sessions logicielles via des séries de captures d'écran. - Évaluation par lots de formulaires ou d'interfaces utilisateurs nécessitant la vérification croisée de schémas JSON.
Cependant, son statut « Exp » (expérimental), combiné à son obsolescence officielle du côté de l'API DeepSeek et à l'absence d'historique de disponibilité garanti sur OpenRouter, restreint son adoption pour des services en production critique et temps réel. Pour tout nouveau déploiement à long terme, la réalisation d'une suite de tests de régression est impérative, et l'évaluation du modèle DeepSeek-V4.1-Flash demeure vivement conseillée pour assurer la pérennité des flux.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Texte
Type principal de contenu traité ou produit par ce modèle.
Vision
Analyse d'images fournies en entrée (photos, captures, documents visuels).
Fichiers
Peut s'appuyer sur des fichiers joints (documents, extraits) en plus du texte.
Outils
Peut appeler des outils ou des fonctions (recherche, calcul, actions).
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
DeepSeek V4 Flash Vision Exp (Batch) sur
Dernière versiondeepseek/deepseek-v4-flash-vision-exp:batchVisionFichiersOutils- Fenêtre de contexte
- 1 048 576 jetons
- Fenêtre de contexte
- 1 048 576 tokens
- Tarif entrée (batch)
- 0,11 $ / M tokens
- Tarif sortie (batch)
- 0,33 $ / M tokens
- Lecture du cache
- 0,0035 $ / M tokens
- Modalités
- Entrée texte et vision, sortie texte
- Fournisseur amont
- Fireworks (via OpenRouter)
Tarif annoncé : 0.11 $ en entrée, 0.33 $ en sortie, par million de jetons (USD)