Ce que fait ce modèle
Une brique spécialisée pour l'extraction de données web
Lancé officiellement le 16 avril 2026 par Inference.net en parallèle de sa variante Turbo, Schematron V2 Small constitue la seconde génération d'une famille de modèles exclusivement conçus pour une tâche précise : convertir des pages HTML volumineuses et bruitées en objets JSON structurés et typés. Succédant à la première mouture parue en septembre 2025, cette itération s'appuie sur une architecture compacte de 3 milliards de paramètres (3B), accessible sous forme d'API serverless à poids fermés et désormais référencée sur OpenRouter.
Contrairement aux modèles de langage généralistes du marché, Schematron V2 Small ne cherche pas à engager un dialogue, à résumer un texte de manière libre ou à manipuler des outils externes. Il s'agit d'un moteur d'ingestion spécialisé dont le rôle unique est de cartographier la structure sémantique d'un document web brut vers un schéma cible prédéfini.
Un décodage contraint par schéma sans prompt textuel
L'une des singularités majeures de Schematron V2 Small réside dans son protocole d'instruction. Le modèle n'exploite aucun prompt système ou utilisateur traditionnel pour guider la génération. L'unique moyen d'orienter l'extraction consiste à lui fournir la définition de la structure attendue par le biais du paramètre standard response_format. Les formats déclaratifs tels que JSON Schema, Pydantic ou Zod servent directement de directives d'exécution.
Sur le plan algorithmique, le modèle applique un décodage contraint par schéma. La validité syntaxique ainsi que le respect rigoureux des types de données (chaînes, entiers, listes, objets imbriqués) sont garantis « par construction » tout au long de la génération des tokens. Cette méthode élimine le besoin d'outils de réparation après coup (post-processing ou boucles de relance) fréquemment indispensables lorsque l'on emploie des modèles généralistes pour ce type d'opération.
En matière de modalités, Schematron V2 Small est strictement textuel : il reçoit du code HTML en entrée et renvoie du JSON en sortie. Il n'intègre aucune fonction de vision, d'analyse audio ou vidéo, ni de capacités de raisonnement conversationnel étendu.
Fenêtre de contexte, volumétrie et performances
Pour traiter des pages web complexes, Schematron V2 Small dispose d'une large fenêtre de contexte. OpenRouter et la documentation générale d'Inference.net indiquent une capacité maximale de 128 K tokens, bien que la page produit de l'éditeur mentionne un palier de 125 K tokens, sans justification documentée de cet écart. La limite maximale de sortie s'établit quant à elle à 4 K tokens, ce qui suffit largement à la plupart des fiches et représentations d'entités extraites.
Sur le plan des performances comparatives, Inference.net a évalué le modèle au moyen d'un benchmark propriétaire supervisé par un juge LLM (« GPT 5.4 ») sur une note de 1 à 5. Schematron V2 Small y obtient un score de 4,060, surpassant nettement l'ancien Schematron 3B (3,909) et égalant presque l'ancienne déclinaison 8B (4,070). Le fournisseur indique également que le modèle devance des architectures telles que DeepSeek V3.2 et GPT-5.4 Nano sur cette tâche d'extraction ciblée, bien que les résultats chiffrés précis de ces concurrents ne soient pas publiés. Ces mesures émanent exclusivement du fournisseur et n'ont pas encore fait l'objet d'audits indépendants.
En termes de débit de production, le modèle est mesuré à 2,47 requêtes par seconde sur un accélérateur H100 pour une charge type de 10 000 tokens en entrée et 500 tokens en sortie, assurant une vitesse d'exécution adaptée aux flux industriels.
Cas d'usage recommandés et limites opérationnelles
Schematron V2 Small est taillé pour automatiser les pipelines de données web :
- Le web scraping structuré à grande échelle.
- L'ingestion et la standardisation de catalogues de produits e-commerce.
- L'extraction automatisée de fiches d'entreprises et de profils professionnels.
- La transformation de pages documentaires hétérogènes en jeux de données exploitables.
Néanmoins, plusieurs limites techniques doivent être prises en considération. Premièrement, le respect de la structure JSON n'est pas synonyme d'exactitude sémantique. Si une information est absente, trompeuse ou ambiguë au sein du code source, le modèle peut produire un champ vide ou imprécis. L'éditeur recommande dès lors d'inclure des descriptions très explicites dans le schéma JSON pour clarifier les attentes métier.
Deuxièmement, les documents dépassant la limite de contexte doivent impérativement faire l'objet d'un découpage préalable. Le fournisseur conseille également d'appliquer un pré-nettoyage du code source à l'aide d'outils tels que lxml afin d'éliminer les balises de scripts, les styles CSS et le contenu périphérique inutile avant l'envoi au modèle.
Schematron V2 Small présente une tarification particulièrement compétitive sur OpenRouter, arrêtée à 0,05 $ par million de tokens en entrée et 0,23 $ par million de tokens en sortie (actualisant les tarifs initiaux annoncés lors du lancement d'avril).
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Texte
Type principal de contenu traité ou produit par ce modèle.
Outils
Peut appeler des outils ou des fonctions (recherche, calcul, actions).
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
InferenceNet Schematron V2 Small
Dernière versioninference-net/schematron-v2-smallOutils- Fenêtre de contexte
- 128 000 jetons
- Sortie maximale
- 4 000 jetons
- Taille du modèle
- 3 milliards de paramètres (3B)
- Fenêtre de contexte
- 128 K tokens (jusqu'à 125 K-128 K selon la documentation)
- Longueur de sortie maximale
- 4 K tokens
- Spécialisation
- Extraction HTML vers JSON contrainte par schéma
- Tarification
- 0,05 $ / M d'entrée | 0,23 $ / M de sortie
Tarif annoncé : 0.05 $ en entrée, 0.23 $ en sortie, par million de jetons (USD)