Texte

Inference Net

Schematron V2 Turbo

Schematron V2 Turbo, un modèle 3B spécialisé dans l'extraction de données HTML vers JSON, alliant haut débit et décodage contraint par schéma.

Dernière version
InferenceNet Schematron V2 Turbo
Numéro de version
2
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Conçu par InferenceNet et officialisé le 16 avril 2026, Schematron V2 Turbo s'impose comme un modèle spécialisé résolument orienté vers les charges de travail d'ingénierie de données. Doté de 3 milliards de paramètres, il a été développé pour accomplir une tâche précise : transformer un code HTML brut et bruité en un document JSON strictement conforme à un schéma prédéfini. Au sein de la gamme Schematron V2, qui comprend également la déclinaison V2 Small, cette version Turbo incarne l'alternative axée sur la vitesse d'exécution et la réduction des coûts de traitement.

Un fonctionnement guidé par schéma et sans prompt conversationnel

Contrairement aux modèles de langage généralistes qui réagissent à des instructions en langage naturel via des invites système ou utilisateur, Schematron V2 Turbo fonctionne exclusivement en texte-vers-texte sous contrainte technique. La documentation d'InferenceNet précise expressément que les prompts textuels classiques ne servent pas à guider l'extraction. L'intégralité du pilotage opérationnel est déléguée au paramètre response_format, configuré au moyen d'un JSON Schema ou de structures typées issues de bibliothèques telles que Pydantic ou Zod.

Le moteur exploite un décodage contraint par le schéma, ce qui permet au fournisseur d'annoncer une adhérence structurelle au format JSON de 100 %. Cette caractéristique offre l'assurance d'obtenir une structure syntaxiquement irréprochable en sortie, éliminant les erreurs de parsing fréquentes lors de l'extraction par des LLM classiques. Il convient toutefois de distinguer la forme du fond : la conformité syntaxique garantie par le moteur ne préjuge pas de l'exactitude sémantique intrinsèque des informations extraites de la page.

Contrairement aux premières versions Schematron 3B et 8B qui proposaient des poids ouverts, la génération V2 adopte des poids fermés, accessibles uniquement par le biais de l'API serverless d'InferenceNet ou via des agrégateurs partenaires.

Fenêtre contextuelle et caractéristiques techniques

Le modèle dispose d'une fenêtre de contexte atteignant 128 000 tokens (parfois mentionnée à 125 000 tokens selon les conventions d'affichage de l'éditeur), ce qui permet d'ingérer des structures HTML massives. Sa capacité de génération en sortie est fixée à 8 000 tokens. Si la fenêtre d'entrée est généreuse, le fournisseur recommande néanmoins de tronquer ou de segmenter les pages d'un volume excessif pour optimiser le débit et la pertinence.

Schematron V2 Turbo se concentre strictement sur l'analyse de texte HTML. Il n'intègre aucune modalité visuelle, audio ou de génération d'images, et ne dispose d'aucun mécanisme de raisonnement autonome ou d'appel d'outils (tool calling). Il ne doit donc pas être confondu avec un agent web autonome ou un modèle multimodal.

Performances et débit face à la concurrence

Les données de performance publiées par InferenceNet mettent en avant l'efficacité de l'architecture 3B dans son créneau d'application. Dans un protocole d'évaluation de type « LLM-as-a-judge » noté de 1 à 5 sous l'arbitrage de GPT-5.4, Schematron V2 Turbo obtient un score de 4,039. Ce résultat progresse par rapport aux 3,909 points de l'ancienne version Schematron 3B, tout en restant légèrement en retrait par rapport à Schematron V2 Small (4,060), davantage optimisé pour les pages très denses et les schémas complexes. Si le constructeur mentionne des scores supérieurs à DeepSeek V3.2 et GPT-5.4 Nano sur ce protocole, ces données doivent être considérées avec réserve en l'absence de chiffres comparatifs détaillés et d'audits indépendants.

Le gain principal réside dans la vélocité. Lors de benchmarks réalisés sur carte Nvidia H100 pour des requêtes types de 10 000 tokens en entrée et 500 tokens en sortie, la version Turbo atteint un débit de 4,14 requêtes par seconde. À titre de comparaison, Schematron V2 Small et l'ancien Schematron 3B plafonnent à 2,47 requêtes par seconde, tandis que l'ancien modèle 8B traitait 1,63 requête par seconde.

Intégré dans un pipeline complet de recherche web combinant GPT-5 Nano et Exa sur le benchmark SimpleQA, le système motorisé par Turbo enregistre un score de 79,42 (contre 75,47 pour l'ancien Schematron 3B et 83,10 pour V2 Small), validant son efficacité au sein d'architectures d'extraction opérationnelles.

Cas d'usage et gestion des limites

Ce positionnement technique fait de Schematron V2 Turbo un choix adapté aux projets d'extraction massive et d'ETL web, tels que : - L'agrégation de fiches produits et la veille tarifaire en e-commerce ; - Le parsing automatisé de tableaux comparatifs et d'annuaires ; - La conversion de documents HTML complexes en bases de données relationnelles ou vectorielles.

Le modèle montre en revanche ses limites lorsqu'un champ exige une synthèse interprétative ou un raisonnement déductif complexe à partir d'informations partielles. Pour pallier cette faiblesse, les développeurs doivent formuler des descriptions extrêmement détaillées et non ambiguës au sein des propriétés du schéma JSON fourni.

Sur le plan tarifaire, le modèle se distingue par un coût très bas, affiché à 0,03 $ par million de tokens d'entrée et 0,15 $ par million de tokens de sortie, ce qui en fait l'une des solutions d'extraction les plus économiques du marché pour le traitement en volume.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    InferenceNet Schematron V2 Turbo

    Dernière version

    inference-net/schematron-v2-turbo

    Outils
    Fenêtre de contexte
    128 000 jetons
    Sortie maximale
    8 000 jetons
    Taille du modèle
    3 milliards de paramètres
    Fenêtre de contexte
    Jusqu'à 128 000 tokens
    Longueur de sortie maximale
    8 000 tokens
    Format d'entrée / sortie
    HTML brut vers JSON typé
    Pilotage opérationnel
    JSON Schema / Pydantic / Zod via response_format
    Tarification OpenRouter
    0,03 $ / M (entrée) | 0,15 $ / M (sortie)

    Tarif annoncé : 0.03 $ en entrée, 0.15 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca