Ce que fait ce modèle
Présentation du modèle et architecture
L'évolution des technologies de représentation vectorielle a permis de franchir un cap majeur dans la recherche d'information et la compréhension du langage naturel. C'est dans ce contexte que s'inscrit le modèle intfloat/e5-base-v2, développé à l'origine par Microsoft et issu de la famille de modèles E5. Ce modèle repose sur les travaux de recherche détaillés dans l'article scientifique "Text Embeddings by Weakly-Supervised Contrastive Pre-training" publié le 7 décembre 2022. Les poids du modèle ont quant à eux été initialisés et téléversés sur Hugging Face le 19 mai 2023.
Sur la plateforme OpenRouter, ce modèle a été répertorié le 18 novembre 2025 et est routé via le fournisseur unique DeepInfra. Contrairement aux modèles de langage génératifs ou conversationnels, intfloat/e5-base-v2 est un encodeur de texte pur. Son architecture s'appuie sur un modèle de type BERT comprenant 12 couches. Son rôle exclusif est de transformer des phrases, des paragraphes ou des documents en vecteurs denses de 768 dimensions, facilitant ainsi les calculs de similarité sémantique.
Capacités et modalités techniques
Pour intégrer efficacement intfloat/e5-base-v2, il est crucial de comprendre la gestion de sa fenêtre de contexte. Bien que l'interface d'OpenRouter affiche une mention générique de "Context 8K", les spécifications techniques réelles du modèle et les données du fournisseur DeepInfra indiquent une limite stricte de 512 tokens ("Total Context 512" et "Max Output 512"). La documentation officielle sur Hugging Face confirme que tout texte dépassant cette limite de 512 tokens est tronqué. Pour un modèle d'embeddings, la notion de "max output" ne correspond pas à une génération de texte, mais à la production du vecteur de 768 dimensions. La limite opérationnelle d'entrée à retenir pour vos développements est donc de 512 tokens.
Une autre spécificité essentielle réside dans l'utilisation de préfixes obligatoires lors de la phase d'encodage. Pour garantir des performances optimales, vous devez formater vos entrées de la manière suivante : - Ajoutez le préfixe query: devant les requêtes de recherche. - Ajoutez le préfixe passage: devant les documents ou les paragraphes destinés à être stockés ou indexés.
L'omission de ces préfixes dégrade significativement la qualité des représentations vectorielles. De plus, il est normal de constater que la distribution des scores de similarité cosinus pour ce modèle est particulièrement resserrée, se situant généralement dans une plage allant de 0,7 à 1,0.
Positionnement et performances
Avec ses 110 millions de paramètres et une taille de 0,41 Go en précision fp32, intfloat/e5-base-v2 se positionne comme un encodeur dense de taille intermédiaire extrêmement compétitif.
Sur le plan des performances globales, les benchmarks de référence mettent en évidence sa robustesse : - Score BEIR : Le modèle obtient un score de 50,3, ce qui le place juste derrière la version supérieure E5-large-v2 (50,6) mais nettement devant la première version E5-base (48,8). - Leaderboard MTEB : Sur 56 jeux de données évalués, il affiche un score moyen de 61,56, ce qui le positionne au 69e rang du classement consulté. Bien que des modèles plus récents comme gte-base ou nomic-embed-text-v1 affichent des scores légèrement supérieurs, e5-base-v2 reste largement plus performant que des modèles historiques comme bert-base-uncased.
Ce modèle représente donc un excellent compromis entre la légèreté (faible latence, moindre consommation de ressources) et la précision de l'encodage.
Cas d'usage et limites
Le modèle intfloat/e5-base-v2 est particulièrement recommandé pour les applications suivantes : - Pipelines RAG (Retrieval-Augmented Generation) : Indexation de bases de connaissances et recherche de documents pertinents pour alimenter un LLM. - Recherche sémantique : Moteurs de recherche basés sur le sens des requêtes plutôt que sur la simple correspondance de mots-clés. - Déduplication et détection de paraphrases : Identification de textes redondants ou similaires au sein de grands volumes de données. - Clustering et classification : Extraction de caractéristiques textuelles (features) pour entraîner des classifieurs ou regrouper des documents par thématiques.
Ses limites principales sont son exclusivité à la langue anglaise, sa sensibilité à l'absence de préfixes, et sa restriction stricte à 512 tokens par entrée, ce qui exclut le traitement de documents très longs sans découpage préalable (chunking).
Sur OpenRouter, intfloat/e5-base-v2 est proposé à un tarif très avantageux de 0,005 dollar par million de tokens d'entrée. Aucun coût n'est appliqué pour les tokens de sortie, ce qui est cohérent avec la nature non générative du modèle.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Texte
Type principal de contenu traité ou produit par ce modèle.
Outils
Peut appeler des outils ou des fonctions (recherche, calcul, actions).
Embedding
Produit des vecteurs numériques pour la recherche et la similarité.
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
intfloat/e5-base-v2
Dernière versionintfloat/e5-base-v2OutilsEmbedding- Dimensions de l'embedding
- 768
- Fenêtre de contexte maximale
- 512 tokens
- Nombre de paramètres
- 110 millions
- Tarif d'entrée (par M tokens)
- 0,005 $
Tarif annoncé : 0.01 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)