Texte

Voyageai

Rerank 2.5

Un modèle de reranking de pointe optimisé pour le suivi d'instructions et doté d'un contexte étendu à 32 000 tokens.

Dernière version
Voyage AI Rerank 2.5
Numéro de version
2.5
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Un nouveau jalon pour l'ordonnancement de précision

Annoncé officiellement par Voyage AI le 11 août 2025, aux côtés de sa version allégée rerank-2.5-lite, le modèle voyageai/rerank-2.5 succède à rerank-2. Contrairement aux modèles de génération de texte ou d'embeddings traditionnels, ce modèle se positionne exclusivement sur le créneau du reranking (ou réordonnancement) de documents. Son rôle intervient après une première phase de récupération de données, qu'elle soit lexicale (via BM25) ou vectorielle.

En tant que cross-encoder, rerank-2.5 analyse conjointement la requête et chaque document candidat pour évaluer leur pertinence mutuelle. Cette approche diffère fondamentalement des modèles d'embeddings (bi-encoders), qui encodent la requête et les documents de manière isolée avant de calculer une simple similarité cosinus. Le traitement conjoint permet d'obtenir une précision sémantique nettement supérieure pour classer les résultats du plus pertinent au moins pertinent.

Capacités techniques et suivi d'instructions

Le modèle rerank-2.5 est un outil généraliste, textuel et multilingue. Sa principale innovation réside dans sa capacité à suivre des instructions en langage naturel intégrées directement à la requête. Cette fonctionnalité permet de guider précisément le critère de pertinence appliqué par le modèle. Par exemple, un utilisateur peut spécifier s'il souhaite privilégier des textes réglementaires plutôt que des décisions de jurisprudence, ou encore expliciter le sens d'un terme technique propre à un secteur d'activité.

L'API de Voyage AI traite une requête unique sous forme de chaîne de caractères et une liste de documents textuels. En sortie, elle renvoie les indices des documents, leurs scores de pertinence et, si l'option est activée, les documents réordonnés eux-mêmes. Il convient de souligner que rerank-2.5 n'est pas un modèle conversationnel : il ne génère aucun texte de réponse, aucune image, aucun fichier audio ni aucune vidéo. De plus, il ne dispose pas de mécanisme de raisonnement explicite ou de traces de pensée.

Gestion du contexte et limites d'entrée

Le modèle repousse les limites de traitement des volumes de données par rapport à son prédécesseur : Fenêtre de contexte par paire : Elle s'élève à 32 000 tokens pour chaque couple requête-document, soit le double de la version précédente. Limite de la requête : La requête elle-même peut contenir jusqu'à 8 000 tokens. Volume de documents : Une seule requête peut soumettre jusqu'à 1 000 documents candidats. Budget global : Le volume total par requête est plafonné à 600 000 tokens. Ce budget est calculé en multipliant les tokens de la requête par le nombre de documents, puis en y ajoutant les tokens de l'ensemble des documents.

Par défaut, un mécanisme de troncature automatique est activé. Si l'utilisateur choisit de le désactiver, tout dépassement de ces limites matérielles provoquera une erreur de l'API. En sortie, le volume de données est contrôlé par le paramètre top_k. En l'absence de ce paramètre, le modèle retourne le classement complet de tous les candidats soumis.

Performances comparatives annoncées

Les données de performance publiées par Voyage AI mettent en avant une nette progression par rapport aux solutions concurrentes, bien qu'elles n'aient pas encore fait l'objet d'une validation indépendante exhaustive.

Sur un ensemble de 93 jeux de données d'évaluation de recherche (mesurés en NDCG@10 à travers quatre méthodes de récupération initiale), Voyage AI indique que rerank-2.5 surpasse : Cohere Rerank v3.5 de 7,94 % ; Qwen3-Reranker-8B de 2,25 % ; * Rerank-2 (son prédécesseur) de 1,85 %.

Sur le benchmark MAIR (Massive Instructed Retrieval Benchmark), spécifiquement conçu pour évaluer la recherche guidée par instructions, l'écart avec Cohere Rerank v3.5 atteint 12,70 % en faveur de Voyage AI. De plus, le fournisseur rapporte une amélioration moyenne de 8,13 % sur ses propres jeux de données internes lorsque des instructions spécifiques sont fournies dans la requête.

Cas d'usage et limites structurelles

Le modèle excelle dans l'optimisation des pipelines de génération augmentée par récupération (RAG) et de recherche sémantique. Ses domaines de prédilection incluent la recherche documentaire complexe, les bases de données juridiques, financières, techniques ou l'analyse de dépôts de code source.

Cependant, sa nature même de cross-encoder impose des limites d'usage strictes. Ce modèle ne peut pas remplacer une base de données vectorielle, un index inversé ou des embeddings de premier niveau. Appliquer un traitement aussi lourd que le cross-encoding à l'intégralité d'un corpus documentaire volumineux s'avérerait extrêmement coûteux et inefficace en termes de latence. Son rôle est strictement limité au second étage de la recherche (le réordonnancement d'un sous-ensemble pré-sélectionné de documents).

La tarification officielle annoncée par Voyage AI et MongoDB s'élève à 0,05 $ par million de tokens, avec une offre de démarrage comprenant 200 millions de tokens gratuits. Le calcul de la facturation prend en compte la répétition des tokens de la requête pour chaque document évalué, ainsi que les tokens de tous les documents soumis. À titre d'illustration, le coût estimé pour réordonner 100 documents contenant chacun 500 tokens (requête comprise) est d'environ 0,0025 $.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Reranking

Réordonne des résultats de recherche selon leur pertinence.

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Voyage AI Rerank 2.5

    Dernière version

    voyageai/rerank-2.5

    Reranking
    Type de modèle
    Cross-encoder (Reranker)
    Fenêtre de contexte par paire
    32 000 tokens
    Limite de la requête
    8 000 tokens
    Nombre max. de documents
    1 000
    Budget total par requête
    600 000 tokens

    Tarif annoncé : 0.00 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca