Ce que fait ce modèle
Le 8 septembre 2026, Inception a officialisé la sortie de Mercury 2.5, son nouveau modèle de raisonnement généraliste, immédiatement rendu accessible sur la passerelle OpenRouter. Succédant à Mercury 2, cette version se distingue nettement de la majorité des modèles actuels par ses choix architecturaux et son positionnement tarifaire agressif.
Une rupture architecturale : le modèle de langage par diffusion
Alors que la quasi-totalité des modèles de langage contemporains s'appuie sur une génération autorégressive séquentielle (un token calculé après l'autre), Inception a conçu Mercury 2.5 autour d'une architecture de diffusion language model (dLLM). Dans ce paradigme, le réseau produit puis affine simultanément plusieurs tokens par étapes successives de débruitage.
Inception présente Mercury 2.5 comme le plus grand dLLM entraîné à ce jour. Le fournisseur n'a toutefois pas communiqué le volume précis de paramètres, la composition détaillée des données d'entraînement ni les modalités complètes de licence. Cette approche technique originale vise un objectif précis : maximiser la vitesse d'inférence sans dégrader la cohérence du raisonnement.
Modalités, contexte et outillage
Sur le plan des fonctionnalités, Mercury 2.5 est un modèle strictement textuel en entrée et en sortie. Il ne prend pas en charge l'analyse d'images, le traitement de fichiers multimédias, ni la synthèse ou la compréhension audio. Il convient d'ailleurs de ne pas le confondre avec Mercury Voice, une offre distincte annoncée par le laboratoire sous forme d'aperçu.
Accessible via l'interface standardisée v1/chat/completions, le modèle propose plusieurs mécanismes avancés adaptés aux flux applicatifs modernes : - Raisonnement modulable : le paramètre reasoning_effort permet d'ajuster l'intensité de réflexion du modèle en fonction de la complexité de la requête. - Appels d'outils en parallèle : la gestion native des tool calls simultanés facilite l'orchestration au sein de systèmes d'agents. - Sorties structurées : le modèle assure une conformité stricte avec les schémas JSON fournis.
Mercury 2.5 dispose par ailleurs d'une fenêtre de contexte de 260 000 tokens et peut produire jusqu'à 65 536 tokens en un seul appel. Cette amplitude technique le rend particulièrement compétitif pour l'analyse de corpus documentaires denses et la persistance de l'historique conversationnel.
Performances annoncées et positionnement concurrentiel
Le laboratoire Inception met en avant un débit théorique de 1 107 tokens par seconde sur des processeurs graphiques NVIDIA conventionnels, ainsi qu'un gain global de performance de 40 % par rapport à Mercury 2 (exprimé par OpenRouter sous la forme d'une progression supérieure à dix points).
En matière de qualité de réponse, Inception ne cherche pas à concurrencer frontalement les modèles phares les plus massifs et onéreux du marché. L'entreprise calibre explicitement Mercury 2.5 face aux déclinaisons économiques et rapides dites « frontier » : GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite et Claude Haiku 4.5.
Ces données de performance et de comparatif reposent néanmoins exclusivement sur les annonces du concepteur. En l'absence de benchmarks publics détaillés, méthodologiquement documentés et reproductibles par des tiers indépendants, ces chiffres doivent être interprétés avec la retenue d'usage.
Cas d'usage ciblés et réserves opérationnelles
Par son alliance de vitesse, de contexte étendu et de support d'outils, Mercury 2.5 s'adresse en priorité à plusieurs contextes d'ingénierie logicielle : - Pipelines RAG à haute fréquence : traitement accéléré des requêtes d'interrogation documentaire nécessitant de multiples allers-retours. - Orchestration d'agents et sous-agents : gestion du flux textuel à faible latence dans des architectures complexes de développement ou d'assistance client. - Orchestration textuelle d'interfaces vocales : génération ultrarapide des scripts textuels réinjectés dans des moteurs de synthèse vocale externes. - Itération et refactorisation de code : manipulation de bases de code volumineuses avec un délai d'attente réduit.
Inception évoque des retours favorables issus de collaborations partenaires, notamment chez Augment Code et OpenCall. Ces retours constituant des retours d'expérience privés et non des évaluations certifiées, il demeure recommandé de mettre en place des suites de tests automatisés, des garde-fous sur les appels d'outils et une validation factuelle rigoureuse avant tout déploiement sur des scénarios métier critiques.
Au catalogue officiel d'Inception, Mercury 2.5 est annoncé à 0,20 $ par million de tokens d'entrée (0,02 $ en cache) et 0,75 $ par million de tokens de sortie. Le fournisseur applique actuellement une tarification promotionnelle de lancement réduite de 80 %, également répercutée sur OpenRouter : - Entrée : 0,04 $ par million de tokens (0,004 $ avec mise en cache) - Sortie : 0,15 $ par million de tokens
Aucune date d'expiration pour ce tarif de lancement n'a été spécifiée à ce jour.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Texte
Type principal de contenu traité ou produit par ce modèle.
Outils
Peut appeler des outils ou des fonctions (recherche, calcul, actions).
Raisonnement
Peut enchaîner une réflexion prolongée avant de répondre, utile pour les tâches difficiles.
Historique des versions
2 versions reconstituées à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
Inception Mercury 2.5 Preview
Dernière versioninception/mercury-2.5-previewModèle de texte en version préliminaire disponible sur OpenRouter, offrant le support des appels d'outils à un tarif extrêmement compétitif pour le prototypage.
OutilsRaisonnement- Fenêtre de contexte
- 260 000 jetons
- Sortie maximale
- 65 536 jetons
- Fournisseur
- OpenRouter (ID: inception/mercury-2.5-preview)
- Type principal
- Texte
- Appel d'outils (Tools)
- Supporté
- Tarif d'entrée
- 0,04 $ / million de tokens
- Tarif de sortie
- 0,15 $ / million de tokens
Tarif annoncé : 0.04 $ en entrée, 0.15 $ en sortie, par million de jetons (USD)
- Date non communiquée
Inception Mercury 2.5
inception/mercury-2.5- Fenêtre de contexte
- 260 000 jetons
- Sortie maximale
- 65 536 jetons
- Fenêtre de contexte
- 260 000 tokens
- Longueur de sortie maximale
- 65 536 tokens
- Architecture
- Diffusion Language Model (dLLM)
- Vitesse annoncée
- Jusqu'à 1 107 tokens/s
- Modalités
- Texte en entrée, texte en sortie
- Tarif d'entrée (promotionnel)
- 0,04 $ / million de tokens
- Tarif de sortie (promotionnel)
- 0,15 $ / million de tokens
Tarif annoncé : 0.04 $ en entrée, 0.15 $ en sortie, par million de jetons (USD)