Texte

Baai

Bge M3

Un modèle d'embeddings révolutionnaire de BAAI offrant polyvalence, multilinguisme et traitement de documents longs jusqu'à 8K tokens.

Dernière version
BGE-M3
Type
Texte
Versions recensées
1

Ce que fait ce modèle

L'évolution des technologies de recherche d'information et de génération augmentée par récupération (RAG) repose de manière critique sur la qualité des représentations vectorielles. C'est dans ce contexte que la Beijing Academy of Artificial Intelligence (BAAI) a développé BGE-M3, un modèle d'embeddings de texte hautement performant. Récemment intégré au catalogue d'OpenRouter, ce modèle se distingue par sa capacité à traiter des volumes importants de texte tout en offrant une flexibilité d'usage inédite. Contrairement aux grands modèles de langage (LLM) traditionnels, BGE-M3 est un modèle unimodal strictement dédié à la représentation vectorielle et à la recherche sémantique.

Les trois piliers de BGE-M3 : Polyvalence, Multilinguisme et Granularité

Le modèle BGE-M3 (où le "M3" fait écho à ses trois caractéristiques majeures) propose une approche holistique pour surmonter les limites des modèles d'embeddings classiques. Avec une taille de 569 millions de paramètres et un poids de 2,27 Go, il encode les phrases, paragraphes et longs documents en vecteurs denses de 1 024 dimensions. Ses trois piliers fondamentaux sont :

  • Multi-Functionality (Polyvalence fonctionnelle) : BGE-M3 est capable d'exécuter simultanément trois types de recherche : la recherche dense (dense retrieval), la recherche lexicale ou creuse (sparse retrieval) et la recherche multi-vectorielle (ColBERT). Cette polyvalence permet de concevoir des architectures de recherche hybrides extrêmement robustes sans multiplier les modèles sous-jacents.
  • Multi-Linguality (Multilinguisme étendu) : Le modèle a été entraîné pour prendre en charge plus de 100 langues différentes, facilitant les tâches de recherche multilingue et cross-lingue (recherche d'un document dans une langue à partir d'une requête formulée dans une autre).
  • Multi-Granularity (Granularité variable) : BGE-M3 gère des longueurs de texte très diverses, allant de simples phrases courtes jusqu'à des documents complexes grâce à une fenêtre de contexte étendue de 8 192 tokens (8K).

Positionnement et performances face aux standards du marché

Les performances de BGE-M3 doivent être analysées sous l'angle de la récupération d'information et non du raisonnement logique ou de la génération textuelle. Lors des évaluations présentées par la BAAI dans ses publications scientifiques (notamment lors des Findings of ACL 2024), le modèle a démontré des capacités de pointe sur les tâches multilingues et la recherche dans les documents longs.

Sur le benchmark de référence NarrativeQA, qui évalue la recherche d'informations au sein de longs récits, BGE-M3 se positionne de manière très compétitive lorsqu'il est utilisé dans sa configuration complète (combinant tous ses modes de recherche). Dans cette configuration globale ("All"), BGE-M3 atteint un score de 61,7 nDCG@10. À titre de comparaison, ce résultat dépasse largement d'autres solutions propriétaires et open-source du marché : - text-embedding-3-large d'OpenAI obtient un score de 51,6 nDCG@10. - E5-mistral-7b se positionne à 49,9 nDCG@10. - text-embedding-ada-002 affiche 41,1 nDCG@10. - jina-embeddings-v2-base-en se situe à 39,4 nDCG@10.

Cependant, il convient de nuancer ces résultats. Lorsque BGE-M3 est exploité uniquement dans son mode de recherche dense (dense retrieval), son score sur NarrativeQA descend à 48,7 nDCG@10. Dans cette configuration restreinte, il s'avère moins performant que le modèle text-embedding-3-large d'OpenAI. Le positionnement réel de BGE-M3 dépend donc de la méthode d'implémentation choisie : l'exploitation combinée (hybride) de ses capacités est indispensable pour en tirer le plein potentiel.

Cas d'usage recommandés et limites techniques

BGE-M3 est particulièrement recommandé pour les architectures logicielles nécessitant une grande précision dans la sélection de l'information. Ses cas d'usage optimaux incluent : - La recherche sémantique et documentaire : Idéal pour indexer de grandes bases de connaissances d'entreprise et effectuer des recherches basées sur le sens plutôt que sur de simples mots-clés. - Les pipelines RAG (Retrieval-Augmented Generation) multilingues : Permet d'alimenter des LLM avec des contextes précis extraits de bases de données volumineuses et multilingues. - La recherche hybride et le re-ranking : La documentation officielle conseille d'associer BGE-M3 à des techniques de re-ranking et à des pondérations lexicales de type BM25 pour maximiser la pertinence des résultats.

Malgré ses forces, le modèle présente certaines limites documentées par les chercheurs de la BAAI. Tout d'abord, sa capacité de généralisation reste à valider sur des scénarios réels très diversifiés. De plus, le traitement de documents extrêmement longs peut poser des défis en termes de coût computationnel et d'efficacité opérationnelle. Bien que la fenêtre de contexte théorique s'élève à 8 192 tokens, le comportement exact et la qualité des embeddings au-delà de cette limite ne sont pas formellement établis. Enfin, les performances peuvent fluctuer d'une langue à l'autre, les données d'entraînement multilingues présentant par nature des déséquilibres quantitatifs et qualitatifs.

BGE-M3 est désormais listé sur OpenRouter, qui propose un tarif d'entrée extrêmement compétitif de 0,01 $ par million de tokens pour le traitement des requêtes (tokens d'entrée), tandis que les tokens de sortie sont facturés à 0,00 $ (ce qui est logique pour un modèle d'embeddings qui ne génère pas de texte mais renvoie des vecteurs).

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Embedding

Produit des vecteurs numériques pour la recherche et la similarité.

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    BGE-M3

    Dernière version

    baai/bge-m3

    OutilsEmbedding
    Fenêtre de contexte
    8 192 tokens (8K)
    Dimension des embeddings
    1 024
    Nombre de paramètres
    569 millions
    Taille du modèle
    2,27 Go
    Tarif d'entrée (OpenRouter)
    0,01 $ / million de tokens

    Tarif annoncé : 0.01 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca