Texte

NVIDIA

Nemotron 3 Embed 1b:free

Le modèle d'embeddings Nemotron-3-Embed-1B de NVIDIA : une solution ultra-performante de 1,14B de paramètres pour le RAG et la recherche sémantique.

Dernière version
Nemotron-3-Embed-1B
Numéro de version
3
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Analyse de NVIDIA Nemotron-3-Embed-1B : L'état de l'art des embeddings légers et multilingues

Présentation du modèle et apports technologiques

Lancé officiellement le 16 juillet 2026, le modèle Nemotron-3-Embed-1B-BF16 de NVIDIA marque une étape importante dans le domaine des modèles d'embeddings de texte ouverts et utilisables commercialement. Conçu spécifiquement pour répondre aux besoins de la recherche d'information moderne, ce modèle de taille intermédiaire s'adresse particulièrement aux architectures de génération augmentée par la récupération (RAG), à la recherche agentique, à la recherche de code ainsi qu'à la gestion de la mémoire des agents autonomes.

NVIDIA propose ici un outil optimisé pour offrir un excellent compromis entre qualité de récupération, latence d'exécution et coûts d'infrastructure. En s'appuyant sur une architecture ouverte, ce modèle permet aux développeurs d'intégrer des capacités de recherche sémantique avancées au sein de pipelines de données complexes, sans subir la lourdeur opérationnelle des modèles de plus grande taille.

Capacités techniques et modalités de fonctionnement

Le Nemotron-3-Embed-1B est un modèle strictement limité au traitement de texte (text-only). Il ne dispose d'aucune capacité de génération de texte, de vision, d'audio ou de raisonnement conversationnel. Son unique rôle est de transformer des segments de texte en vecteurs denses de 2048 dimensions au format BF16.

Architecture et compression

D'un point de vue architectural, ce modèle s'appuie sur un Transformer dérivé de Ministral-3-3B-Instruct-2512. Pour atteindre sa taille finale d'environ 1,14 milliard de paramètres, il a subi un processus rigoureux de compression structuré en deux cycles de pruning (élagage) structuré et de distillation de connaissances. Cette méthode permet de conserver une grande partie des performances du modèle source tout en réduisant considérablement l'empreinte mémoire et le temps de calcul.

Gestion du contexte et formats de sortie

La gestion de la longueur du contexte présente deux aspects distincts : - Capacité architecturale : Le modèle est conçu pour supporter une longueur maximale de 32 768 tokens. - Limites de service : Dans la pratique, la matrice de support de NVIDIA NeMo Retriever NIM et l'API officielle valident actuellement une limite de 4 096 tokens pour l'endpoint /v1/embeddings.

Contrairement à d'autres modèles du marché, le Nemotron-3-Embed-1B ne prend pas en charge la réduction dynamique des dimensions via l'API NIM (le paramètre dimensions n'est pas supporté). En revanche, le runtime NIM s'avère flexible quant aux formats d'embeddings pris en charge en sortie, proposant les types float, int8, uint8, binary et ubinary (les formats binaires nécessitant une métrique de distance adaptée, telle que la distance de Hamming).

Spécificités d'appel : Query vs Passage

Pour garantir une efficacité maximale, le modèle requiert de spécifier explicitement le type d'entrée via le paramètre input_type, en choisissant entre le mode query (pour la requête de recherche) et le mode passage (pour le texte à indexer). NVIDIA avertit formellement qu'une mauvaise configuration de ce paramètre peut dégrader de manière très significative la qualité de la récupération sémantique.

Positionnement et performances comparatives

NVIDIA positionne le Nemotron-3-Embed-1B comme une solution de pointe (state-of-the-art) parmi les modèles de sa catégorie de taille (environ 1 milliard de paramètres). Lors des évaluations de référence, le modèle a démontré des résultats solides : - 72,38 sur le benchmark RTEB 16 ; - 57,76 sur ViDoRE-V3 (évaluation textuelle) ; - 71,05 sur MMTEB Retrieval (mesuré en NDCG@10 à 4096 tokens).

Ces performances le placent nettement au-dessus des versions précédentes de la marque, telles que llama-nemotron-embed-1b-v2 et llama-nemotron-embed-vl-1b-v2. Au sein de la famille Nemotron 3 Embed, la version 1B représente le choix de l'efficacité opérationnelle (latence et coût), tandis que la déclinaison 8B fait office de référence absolue en matière de qualité pure.

Cas d'usage concrets et limites du modèle

Le modèle excelle dans plusieurs scénarios d'application : - RAG Multilingue : Grâce à une évaluation rigoureuse sur 34 langues (dont le français, l'anglais, l'allemand, l'espagnol, le chinois, le japonais, l'arabe, l'hindi, le russe et le vietnamien), il s'intègre parfaitement dans des bases de connaissances internationales. - Recherche de code et sémantique : Idéal pour indexer des dépôts de code ou des documentations techniques volumineuses. - Mémoire d'agents : Permet de stocker et de retrouver rapidement les interactions passées d'un agent autonome sous forme de vecteurs denses.

Limites identifiées

Les utilisateurs doivent toutefois composer avec certaines contraintes : - Absence totale de capacités génératives ou multimodales. - Impossibilité de réduire dynamiquement la taille du vecteur de 2048 dimensions via l'API. - Nécessité d'effectuer un découpage (chunking) ou une troncature des textes longs en amont pour respecter la limite pratique de l'endpoint (4096 tokens). - Sensibilité critique au choix du mode d'entrée (query ou passage).

Bien que NVIDIA propose ce modèle gratuitement pour le prototypage via ses propres canaux (Build.NVIDIA.com et le programme développeur), son intégration sur OpenRouter suit un statut particulier.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Embedding

Produit des vecteurs numériques pour la recherche et la similarité.

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Nemotron-3-Embed-1B

    Dernière version

    nvidia/nemotron-3-embed-1b:free

    Embedding
    Fenêtre de contexte (architecturale)
    32 768 tokens
    Fenêtre de contexte (API validée)
    4 096 tokens
    Dimensions de l'embedding
    2048 (BF16)
    Nombre de paramètres
    1,14 milliard
    Langues supportées
    34 langues

    Tarif annoncé : 0.00 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca