Texte

Thenlper

Gte Base

Un modèle d'embeddings texte optimisé pour la recherche sémantique et le RAG, désormais disponible via OpenRouter.

Dernière version
thenlper/gte-base
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Le modèle thenlper/gte-base n'est pas une nouveauté scientifique récente, mais un pilier établi dans le domaine des représentations vectorielles du texte (embeddings). Issu de la famille GTE (General Text Embeddings), ce modèle a été rendu disponible sur la plateforme OpenRouter le 18 novembre 2025, avec un hébergement assuré par DeepInfra. Les fondements théoriques de ce modèle reposent sur l'article de recherche intitulé « Towards General Text Embeddings with Multi-stage Contrastive Learning », publié sur arXiv le 7 août 2023. Développé à l'origine par la prestigieuse Alibaba DAMO Academy, gte-base s'est rapidement imposé comme une référence pour la similarité sémantique et la recherche d'informations.

Architecture technique et spécifications

Contrairement aux grands modèles de langage (LLM) génératifs, gte-base est un modèle d'embeddings encodeur basé principalement sur l'architecture BERT. Son rôle unique est de transformer un texte d'entrée en un vecteur dense de 768 dimensions, capturant ainsi la sémantique profonde du contenu. Côté taille, la fiche Hugging Face fait état d'environ 0,1 milliard de paramètres, tandis que l'article de recherche original précise un compte exact de 110 millions de paramètres.

Une ambiguïté notable concerne la fenêtre de contexte de ce modèle. D'un côté, OpenRouter affiche une capacité de traitement de 8K tokens (8 192 tokens). De l'autre, la documentation officielle de Hugging Face et la page de DeepInfra (l'hébergeur sous-jacent) indiquent une longueur de séquence native limitée à 512 tokens, précisant que tout texte dépassant cette limite est tronqué. En l'absence de résolution publique de cette divergence, les utilisateurs doivent garder à l'esprit que la limite native du modèle est de 512 tokens, même si l'API d'OpenRouter déclare accepter jusqu'à 8K tokens. Enfin, s'agissant d'un modèle d'embeddings, la notion de "completion tokens" ou de génération de texte ne s'applique pas : le modèle ne produit aucun texte en sortie, mais uniquement des représentations vectorielles.

Performances et positionnement concurrentiel

Lors de sa publication, gte-base a bousculé les standards du secteur grâce à son efficacité remarquable par rapport à sa taille. Sur le benchmark de référence MTEB (Massive Text Embedding Benchmark) legacy, qui regroupe 56 tâches d'évaluation, le modèle affiche une moyenne globale de 62,39. Dans le détail, il obtient des scores de 51,14 en récupération d'information (retrieval), 82,3 en similarité sémantique (STS) et 58,61 en réordonnancement (reranking).

Ces résultats le positionnent très favorablement face à ses concurrents de l'époque. Bien qu'il se situe légèrement derrière sa version plus lourde gte-large (qui affiche une moyenne de 63,13), gte-base surpasse des modèles populaires tels que e5-base-v2 (61,5) et même l'API propriétaire d'OpenAI text-embedding-ada-002 (60,99). L'article de recherche souligne d'ailleurs que, malgré ses modestes 110 millions de paramètres, gte-base parvient à dépasser des modèles bien plus volumineux. Il convient toutefois de contextualiser ces performances comme des résultats historiques (legacy) et non comme un classement absolu face aux modèles de 2026.

Cas d'usage recommandés et limites

Grâce à son architecture légère et ses performances solides, gte-base est particulièrement recommandé pour les tâches nécessitant une grande efficacité avec des ressources matérielles limitées. Les cas d'usage optimaux incluent :

  • Les pipelines de génération augmentée par récupération (RAG) pour indexer et rechercher des passages de documents.
  • La recherche sémantique et la récupération d'informations au sein de bases de données vectorielles.
  • Le clustering de documents et la déduplication de textes.
  • Le calcul de scores de similarité textuelle et le pré-filtrage avant réordonnancement (reranking).

Selon la documentation de Pinecone, le modèle brille particulièrement lorsqu'il s'agit de traiter des requêtes courtes pour retourner des passages de taille moyenne.

Cependant, le modèle présente des limites claires qu'il convient de prendre en compte. Tout d'abord, il est principalement optimisé pour la langue anglaise et ne constitue pas une solution multilingue généraliste. De plus, il est strictement non génératif et dépourvu de toute capacité multimodale (pas de traitement de l'image, de l'audio ou de la vidéo). Enfin, la troncature systématique à 512 tokens au niveau du modèle natif restreint son usage à des textes courts ou moyennement longs préalablement découpés (chunking).

Sur le plan économique, gte-base se distingue par un coût extrêmement compétitif de 0,005 $ par million de tokens, un tarif identique et cohérent entre OpenRouter et DeepInfra. Actuellement, OpenRouter liste DeepInfra comme unique fournisseur pour ce modèle, sans option de routage alternatif.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Embedding

Produit des vecteurs numériques pour la recherche et la similarité.

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    thenlper/gte-base

    Dernière version

    thenlper/gte-base

    OutilsEmbedding
    Dimensions de l'embedding
    768
    Nombre de paramètres
    110 millions (0,1B)
    Fenêtre de contexte
    512 tokens (natif) / 8K tokens (déclaré OpenRouter)
    Tarif de traitement
    0,005 $ / million de tokens

    Tarif annoncé : 0.01 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca