Texte

Inference Net

Schematron V2 Small

Schematron V2 Small, modèle 3B d'InferenceNet dédié à l'extraction HTML vers JSON contrainte par schéma, économique et optimisé pour le scraping.

Dernière version
InferenceNet Schematron V2 Small
Numéro de version
2
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Une brique spécialisée pour l'extraction de données web

Lancé officiellement le 16 avril 2026 par Inference.net en parallèle de sa variante Turbo, Schematron V2 Small constitue la seconde génération d'une famille de modèles exclusivement conçus pour une tâche précise : convertir des pages HTML volumineuses et bruitées en objets JSON structurés et typés. Succédant à la première mouture parue en septembre 2025, cette itération s'appuie sur une architecture compacte de 3 milliards de paramètres (3B), accessible sous forme d'API serverless à poids fermés et désormais référencée sur OpenRouter.

Contrairement aux modèles de langage généralistes du marché, Schematron V2 Small ne cherche pas à engager un dialogue, à résumer un texte de manière libre ou à manipuler des outils externes. Il s'agit d'un moteur d'ingestion spécialisé dont le rôle unique est de cartographier la structure sémantique d'un document web brut vers un schéma cible prédéfini.

Un décodage contraint par schéma sans prompt textuel

L'une des singularités majeures de Schematron V2 Small réside dans son protocole d'instruction. Le modèle n'exploite aucun prompt système ou utilisateur traditionnel pour guider la génération. L'unique moyen d'orienter l'extraction consiste à lui fournir la définition de la structure attendue par le biais du paramètre standard response_format. Les formats déclaratifs tels que JSON Schema, Pydantic ou Zod servent directement de directives d'exécution.

Sur le plan algorithmique, le modèle applique un décodage contraint par schéma. La validité syntaxique ainsi que le respect rigoureux des types de données (chaînes, entiers, listes, objets imbriqués) sont garantis « par construction » tout au long de la génération des tokens. Cette méthode élimine le besoin d'outils de réparation après coup (post-processing ou boucles de relance) fréquemment indispensables lorsque l'on emploie des modèles généralistes pour ce type d'opération.

En matière de modalités, Schematron V2 Small est strictement textuel : il reçoit du code HTML en entrée et renvoie du JSON en sortie. Il n'intègre aucune fonction de vision, d'analyse audio ou vidéo, ni de capacités de raisonnement conversationnel étendu.

Fenêtre de contexte, volumétrie et performances

Pour traiter des pages web complexes, Schematron V2 Small dispose d'une large fenêtre de contexte. OpenRouter et la documentation générale d'Inference.net indiquent une capacité maximale de 128 K tokens, bien que la page produit de l'éditeur mentionne un palier de 125 K tokens, sans justification documentée de cet écart. La limite maximale de sortie s'établit quant à elle à 4 K tokens, ce qui suffit largement à la plupart des fiches et représentations d'entités extraites.

Sur le plan des performances comparatives, Inference.net a évalué le modèle au moyen d'un benchmark propriétaire supervisé par un juge LLM (« GPT 5.4 ») sur une note de 1 à 5. Schematron V2 Small y obtient un score de 4,060, surpassant nettement l'ancien Schematron 3B (3,909) et égalant presque l'ancienne déclinaison 8B (4,070). Le fournisseur indique également que le modèle devance des architectures telles que DeepSeek V3.2 et GPT-5.4 Nano sur cette tâche d'extraction ciblée, bien que les résultats chiffrés précis de ces concurrents ne soient pas publiés. Ces mesures émanent exclusivement du fournisseur et n'ont pas encore fait l'objet d'audits indépendants.

En termes de débit de production, le modèle est mesuré à 2,47 requêtes par seconde sur un accélérateur H100 pour une charge type de 10 000 tokens en entrée et 500 tokens en sortie, assurant une vitesse d'exécution adaptée aux flux industriels.

Cas d'usage recommandés et limites opérationnelles

Schematron V2 Small est taillé pour automatiser les pipelines de données web :

  • Le web scraping structuré à grande échelle.
  • L'ingestion et la standardisation de catalogues de produits e-commerce.
  • L'extraction automatisée de fiches d'entreprises et de profils professionnels.
  • La transformation de pages documentaires hétérogènes en jeux de données exploitables.

Néanmoins, plusieurs limites techniques doivent être prises en considération. Premièrement, le respect de la structure JSON n'est pas synonyme d'exactitude sémantique. Si une information est absente, trompeuse ou ambiguë au sein du code source, le modèle peut produire un champ vide ou imprécis. L'éditeur recommande dès lors d'inclure des descriptions très explicites dans le schéma JSON pour clarifier les attentes métier.

Deuxièmement, les documents dépassant la limite de contexte doivent impérativement faire l'objet d'un découpage préalable. Le fournisseur conseille également d'appliquer un pré-nettoyage du code source à l'aide d'outils tels que lxml afin d'éliminer les balises de scripts, les styles CSS et le contenu périphérique inutile avant l'envoi au modèle.

Schematron V2 Small présente une tarification particulièrement compétitive sur OpenRouter, arrêtée à 0,05 $ par million de tokens en entrée et 0,23 $ par million de tokens en sortie (actualisant les tarifs initiaux annoncés lors du lancement d'avril).

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    InferenceNet Schematron V2 Small

    Dernière version

    inference-net/schematron-v2-small

    Outils
    Fenêtre de contexte
    128 000 jetons
    Sortie maximale
    4 000 jetons
    Taille du modèle
    3 milliards de paramètres (3B)
    Fenêtre de contexte
    128 K tokens (jusqu'à 125 K-128 K selon la documentation)
    Longueur de sortie maximale
    4 K tokens
    Spécialisation
    Extraction HTML vers JSON contrainte par schéma
    Tarification
    0,05 $ / M d'entrée | 0,23 $ / M de sortie

    Tarif annoncé : 0.05 $ en entrée, 0.23 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca