Texte

NVIDIA

Llama Nemotron Rerank VL 1B V2:free

Le modèle de reranking multimodal de NVIDIA, conçu pour optimiser la recherche de documents complexes associant textes, images et graphiques.

Dernière version
Llama-Nemotron-Rerank-VL-1B-v2
Numéro de version
1
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Introduction : Une révolution pour la recherche de documents complexes

Dans le domaine de la recherche d'information et des architectures RAG (Retrieval-Augmented Generation), l'étape de classement (reranking) est devenue cruciale pour maximiser la pertinence des contextes fournis aux grands modèles de langage. NVIDIA franchit une étape majeure avec le lancement de nvidia/llama-nemotron-rerank-vl-1b-v2, un modèle spécifiquement conçu pour le reranking multimodal. Publié initialement sur Hugging Face en décembre 2025 puis rendu disponible sur Build.NVIDIA.com en mars 2026, ce modèle est désormais accessible via OpenRouter sous sa déclinaison gratuite :free.

Contrairement aux modèles de langage génératifs classiques, ce modèle n'est pas un agent conversationnel. Il s'agit d'un cross-encoder multimodal spécialisé dont l'unique objectif est d'évaluer la pertinence d'un ensemble de documents candidats par rapport à une requête textuelle, que ces documents soient sous forme de texte brut, d'images ou d'un mélange des deux.

Architecture technique : L'alliance de SigLIP 2 et Llama 3.2

D'un point de vue architectural, le modèle s'appuie sur environ 1,7 milliard de paramètres et repose sur la structure Eagle VLM. Il combine deux composants majeurs de l'état de l'art : - Un encodeur visuel SigLIP 2 400M pour le traitement des éléments graphiques. - Un modèle de langage Llama 3.2 1B comme base textuelle. - Une étape de mean pooling suivie d'une tête de classification binaire.

Cette synergie lui permet de traiter des entrées extrêmement variées : pages de documents PDF, diapositives de présentations (slides), captures d'écran, tableaux complexes, graphiques et infographies. En sortie, le modèle ne génère pas de texte, mais produit une liste de valeurs flottantes (des logits de pertinence) qui peuvent être converties en probabilités via une fonction sigmoïde.

La gestion du contexte et ses subtilités

La gestion de la longueur du contexte présente quelques divergences documentées qu'il convient de noter pour vos intégrations techniques : - Le modèle a été finement ajusté (fine-tuned) sur une longueur de contexte de 2 048 tokens. - Il a été testé avec succès jusqu'à 10 240 tokens (les entrées dépassant cette limite étant tronquées). - La matrice de support NVIDIA NeMo Retriever Reranking NIM indique quant à elle une limite de 8 192 tokens pour les configurations optimisées NIM. - Sur OpenRouter, la fiche affiche un contexte de 10K.

Performances et positionnement face à la concurrence

Les évaluations publiées par NVIDIA mettent en avant des gains substantiels en matière de Recall@5 lors de l'intégration de ce reranker dans un pipeline de recherche visuelle. En utilisant le modèle d'embedding complémentaire llama-nemotron-embed-vl-1b-v2 comme premier filtre, l'ajout du reranker permet d'atteindre des scores de : - 76,12 % en modalité texte seul (contre 71,04 % avec l'embedding seul, soit un gain de +7,2 %). - 76,12 % en modalité image seule (contre 71,20 % avec l'embedding seul, soit un gain de +6,9 %). - 77,64 % en modalité mixte image + texte (contre 73,24 % avec l'embedding seul, soit un gain de +6 %).

Face à des solutions concurrentes comme jina-reranker-m0 et MonoQwen2-VL-v0.1, le modèle de NVIDIA s'impose sur les tâches combinant le texte et l'image + texte. En revanche, les benchmarks indiquent que le modèle de Jina conserve un avantage sur la recherche basée uniquement sur des images.

Cas d'usage concrets et limites opérationnelles

Le modèle excelle dans les architectures de RAG multimodal et la recherche au sein de vastes corpus documentaires (par exemple, des rapports financiers contenant des graphiques, des manuels techniques avec schémas, ou des présentations d'entreprise). Il intervient idéalement en phase de sélection top-k : après une première recherche vectorielle large, il réordonne les pages les plus pertinentes pour maximiser la précision du contexte envoyé au LLM final, réduisant ainsi drastiquement les risques d'hallucination.

Cependant, plusieurs limites doivent être prises en compte : - Latence additionnelle : L'utilisation d'un cross-encoder ajoute une étape de calcul supplémentaire qui peut impacter le temps de réponse global. - Problème d'échelle : En raison de sa complexité, il est impossible de l'appliquer directement à l'ensemble d'un grand corpus ; il doit impérativement être positionné après un premier tri (retriever). - Troncation : Les documents trop longs subissent une troncature automatique au-delà de la limite de tokens supportée. - Hébergement : Le déploiement autonome (self-hosting) nécessite des ressources GPU conséquentes.

La variante gratuite de ce modèle est répertoriée sur OpenRouter sous l'identifiant nvidia/llama-nemotron-rerank-vl-1b-v2:free. Elle est servie directement par NVIDIA avec un coût de 0 $ par million de tokens (en entrée comme en sortie).

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Vision

Analyse d'images fournies en entrée (photos, captures, documents visuels).

Reranking

Réordonne des résultats de recherche selon leur pertinence.

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Llama-Nemotron-Rerank-VL-1B-v2

    Dernière version

    nvidia/llama-nemotron-rerank-vl-1b-v2:free

    VisionReranking
    Fenêtre de contexte
    10 240 tokens (testée) / 8 192 tokens (NIM)
    Architecture
    Eagle VLM (~1,7B paramètres)
    Encodeur visuel
    SigLIP 2 400M
    Modèle de langage de base
    Llama 3.2 1B

    Tarif annoncé : 0.00 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca