Ce que fait ce modèle
Le paysage de l'intelligence artificielle ne se résume pas aux modèles de génération de texte conversationnels. Pour exploiter efficacement de grands volumes de données hétérogènes, les entreprises s'appuient de plus en plus sur des modèles d'embeddings (vectorisation). C'est dans ce contexte que NVIDIA a introduit le modèle Llama Nemotron Embed VL 1B V2, disponible gratuitement sur OpenRouter sous l'identifiant nvidia/llama-nemotron-embed-vl-1b-v2:free.
Ce modèle n'est pas un agent conversationnel classique avec lequel vous pouvez dialoguer. Il s'agit d'un outil hautement spécialisé dans la création d'embeddings multimodaux, conçu spécifiquement pour les architectures de recherche documentaire et de génération augmentée par récupération (RAG) au sein de la suite NVIDIA NeMo Retriever.
Une architecture hybride pour une vectorisation unifiée
Le modèle repose sur une architecture de type encodeur Transformer multimodal d'environ 1,7 milliard de paramètres. Il combine deux composants majeurs : - Un backbone textuel Llama 3.2 1B. - Un encodeur de vision SigLip2 400M.
Cette alliance lui permet de traiter simultanément ou séparément des requêtes textuelles et des documents complexes sous forme d'images (pages de PDF, tableaux, graphiques, infographies). Contrairement aux modèles d'embeddings purement textuels, il est capable de projeter dans un même espace vectoriel de dimension 2048 des informations textuelles et visuelles. L'endpoint d'usage standard pour ce modèle est /api/v1/embeddings.
Le casse-tête de la fenêtre de contexte
L'un des points d'attention majeurs pour les développeurs concerne la longueur maximale du contexte, qui varie selon les surfaces de documentation : - OpenRouter affiche une fenêtre de contexte de 131K. - La documentation de l'API NVIDIA indique une longueur maximale de 8192 tokens, recommandant de découper (chunker) ou de tronquer les textes plus longs. - La fiche Hugging Face évoque une limite technique de 10240 tokens dans certains cas d'usage vLLM. - La matrice de support NVIDIA NIM mentionne quant à elle 2048 tokens maximum.
Il convient donc d'aborder la valeur de 131K affichée sur OpenRouter avec prudence. Lors de l'intégration, des tests API rigoureux seront nécessaires pour valider le comportement réel du modèle selon les modalités choisies. En ce qui concerne la sortie, il n'y a pas de génération de texte : le modèle renvoie systématiquement un tableau de flottants (un vecteur dense) de 2048 dimensions.
Performances et positionnement concurrentiel
NVIDIA affiche des performances solides pour ce modèle de taille intermédiaire. Sur les benchmarks de recherche documentaire multimodale (DigitalCorpora-10k, Earnings V2, ViDoRe V1/V2/V3), le modèle atteint un Recall@5 moyen de 73,24 % en mode "Image + Texte". Il surpasse ainsi son prédécesseur propriétaire, le llama-3.2-nemoretriever-1b-vlm-embed-v1 (71,71 %). En mode image seule, le Recall@5 s'élève à 71,20 %.
Pour la recherche purement textuelle, le modèle obtient une moyenne de 67,42 %, ce qui le place légèrement au-dessus de la version texte seul de NVIDIA (llama-nemotron-embed-1b-v2 à 67,19 %).
Sur d'autres évaluations (DigitalCorpora-767, Earnings et ViDoRe V1), le modèle atteint 80,9 % de Recall@5, se positionnant à égalité avec llamaindex/vdr-2b-multi-v1, et devançant des concurrents notables tels que MrLight/dse-qwen2-2b-mrl-v1 et Alibaba-NLP/gme-Qwen2-VL-2B-Instruct.
Cas d'usage recommandés et limites techniques
Le modèle excelle dans les scénarios suivants : - RAG multimodal de production : indexation de documents d'entreprise complexes contenant des schémas, des tableaux financiers ou des graphiques. - Recherche sémantique avancée : indexation page par page de catalogues, de manuels techniques ou de rapports au format PDF. - Assistants internes (IT, RH, R&D) : accélération de la recherche d'informations dans des bases de connaissances mixtes (textes et images).
Cependant, plusieurs limites strictes doivent être prises en compte : - Asymétrie des requêtes : les images ne sont acceptées que comme documents à indexer, et non comme requêtes de recherche. Les requêtes doivent rester textuelles. - Contraintes sur les images : la taille maximale d'une image décodée est limitée à 25 MiB, avec des dimensions maximales de 8192×16384 ou 16384×8192. - Fiabilité : NVIDIA précise que le modèle ne garantit pas systématiquement la récupération du passage exact recherché.
La variante gratuite du modèle, nvidia/llama-nemotron-embed-vl-1b-v2:free, est actuellement détectée sur notre plateforme. Elle est proposée avec un tarif de 0 $ par million de tokens (en entrée comme en sortie).
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Texte
Type principal de contenu traité ou produit par ce modèle.
Vision
Analyse d'images fournies en entrée (photos, captures, documents visuels).
Embedding
Produit des vecteurs numériques pour la recherche et la similarité.
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
Llama Nemotron Embed VL 1B V2
Dernière versionnvidia/llama-nemotron-embed-vl-1b-v2:freeVisionEmbedding- Type de modèle
- Embeddings multimodaux (Texte / Image)
- Architecture
- Llama 3.2 1B + SigLip2 400M (~1.7B paramètres)
- Dimension d'embedding
- 2048 (Vecteur dense)
- Fenêtre de contexte (API)
- 8192 tokens (jusqu'à 131K affichés sur OpenRouter)
- Tarif OpenRouter
- Gratuit (0 $ / million de tokens)
Tarif annoncé : 0.00 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)