Texte

Jaredpalmer

Kev 4B

Kev-4B de Jared Palmer est un modèle de décision pure basé sur Qwen3.5-4B, calculant des distributions de probabilités directes sans génération de texte libre.

Dernière version
Jared Palmer Kev-4B
Numéro de version
4
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Introduction et architecture : un paradigme prédictif sans génération

Développé par Jared Palmer, Kev-4B se démarque nettement des modèles de langage autorégressifs conventionnels. Il ne s'agit pas d'un assistant conversationnel conçu pour produire de la prose ou du code au fil de l'eau, mais d'un modèle open source dédié à la prise de décision, au classement et au routage probabiliste. Publié sous licence Apache-2.0, le projet repose sur une approche épurée de la tâche de classification.

Sur le plan architectural, Kev-4B s'appuie sur la base Qwen/Qwen3.5-4B-Base, enrichie d'un adaptateur LoRA de rang 16 représentant 33,8 millions de paramètres entraînables, couplé à une tête spécifique dite « pointer ». Son fonctionnement tranche avec les flux génératifs standards : le modèle ingère un état textuel ainsi qu'une ou plusieurs requêtes typées, puis calcule directement, en une seule passe avant (« forward pass »), une distribution de probabilités sur les réponses possibles. En éliminant la génération de jetons libres et l'échantillonnage autorégressif, Kev-4B optimise la latence et garantit une structure de réponse strictement déterministe.

Le modèle a connu des itérations rapides en septembre 2026. Après une version datée du 21 septembre 2026 et une refonte orientée sur l'analyse de documents réels le 24 septembre 2026, une seconde mise à jour (« skills delta ») a été publiée le même jour sur Hugging Face. Les versions antérieures basées sur la génération Qwen3 demeurent accessibles sous l'étiquette logicielle dédiée.

Modalités, types de requêtes et gestion du contexte

Kev-4B opère exclusivement sur des flux textuels. Il n'intègre aucune modalité visuelle, audio ou de traitement multimodal. Son interaction s'effectue via une interface compatible TypeSafe (« /v1/systemone »), articulée autour de trois familles de décisions strictes :

  • Les décisions binaires (« noul ») pour les validations de type oui/non ;
  • Les choix multiples (« choice »), capables de traiter de 1 à 255 options prédéfinies ;
  • Les évaluations ordinales (« score »), échelonnant une appréciation sur une échelle discrète de 1 à 255 niveaux.

Le serveur d'inférence autorise une fenêtre technique pouvant accueillir jusqu'à 8 192 tokens pour l'état textuel de référence et 8 192 tokens supplémentaires par question posée. Afin d'éviter tout phénomène de contamination sémantique entre interrogations simultanées, chaque question est traitée sur une ligne isolée. Les questions ne peuvent donc pas s'influencer mutuellement lors du calcul.

Le format de sortie ne consiste pas en une chaîne textuelle arbitraire mais en une structure sérialisée de probabilités. Ainsi, la notion habituelle de plafond de tokens générés ne s'applique pas ; la métrique de sortie n'enregistre que la sérialisation des scores. Cette particularité se reflète directement dans la tarification constatée, fixée à 0,04 $ par million de tokens en entrée et 0,00 $ par million de tokens en sortie.

Néanmoins, une divergence notable subsiste entre les capacités déclarées du serveur et le protocole d'entraînement. Ce dernier n'a exposé le modèle qu'à des états d'une longueur maximale de 384 tokens, et jusqu'à 1 024 tokens pour la combinaison de l'état et de la question. En conséquence, la robustesse statistique et le maintien de la précision sur des contextes réellement longs ne bénéficient pas d'une validation empirique approfondie.

Positionnement technique et performances comparées

Les données de performance publiées par le concepteur fournissent une vision précise du comportement de Kev-4B face à des jeux d'évaluation ciblés. La mise à jour « skills delta » du 24 septembre 2026 a apporté des gains significatifs sur les benchmarks internes par rapport aux premières versions :

  • Sur le jeu de test « hard-v1 » (1 088 questions), le modèle enregistre une exactitude de 0,803, contre 0,540 avant l'intégration des données d'entraînement spécialisées.
  • Sur « devtools-v1 » (1 071 questions), l'exactitude passe de 0,623 à 0,756.

Dans le cadre de ces distributions d'entraînement, Kev-4B surpasse d'une courte tête le modèle Jev (0,786 contre 0,777 sur la validation de hard-v1, et 0,739 contre 0,713 sur devtools). Ces chiffres démontrent une excellente absorption des motifs documentaires ciblés par Jared Palmer.

Cependant, dès lors que l'on observe la généralisation hors domaine, la hiérarchie s'inverse. Sur le jeu d'évaluation hors domaine verrouillé, Kev-4B affiche une exactitude de 0,838 pour un score de Brier de 0,224, tandis que Jev conserve un net avantage sur plusieurs indicateurs de calibration et de transfert. L'écart devient particulièrement saillant sur les tests académiques généralistes : sur MMLU-Pro, Kev-4B plafonne à 0,565 quand Jev atteint 0,840. Ce différentiel confirme que Kev-4B privilégie l'efficacité procédurale sur un ensemble de compétences délimitées plutôt que la mémorisation encyclopédique universelle.

Cas d'usage en entreprise et contraintes opérationnelles

Kev-4B répond aux besoins d'infrastructures automatisées où l'incertitude d'une réponse générative non contrainte présente un risque opérationnel. Grâce à son format de sortie probabiliste, il constitue un composant adapté pour :

  • Le routage de tickets d'assistance vers les départements appropriés ;
  • Le filtrage et la catégorisation systématique de documents administratifs ou techniques ;
  • L'application de règles de conformité et le contrôle du respect de politiques internes ;
  • La sélection, le tri et la priorisation d'éléments au sein de listes d'options prédéterminées ;
  • L'annotation de données à grande échelle couplée à un seuil d'abstention basé sur l'entropie de la distribution.

En contrepartie de cette spécialisation, plusieurs limitations doivent être prises en compte lors du déploiement. Premièrement, le modèle présente une sensibilité mesurable à l'ordre des options fournies dans les requêtes à choix multiples, ce qui peut altérer le résultat final. Deuxièmement, la calibration de ses probabilités tend à se dégrader lors d'un changement abrupt de domaine sémantique. Troisièmement, le modèle manifeste des lacunes sur les connaissances générales complexes ainsi que sur le raisonnement arithmétique lié aux dates. Enfin, sur le plan matériel, l'exécution locale sur architecture Mac souffre d'une inférence lente en raison de l'absence de noyaux MPS adaptés.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Jared Palmer Kev-4B

    Dernière version

    jaredpalmer/kev-4b

    Outils
    Fenêtre de contexte
    8 192 jetons
    Modèle de base
    Qwen/Qwen3.5-4B-Base
    Architecture
    LoRA rang 16 (33,8M paramètres) + tête pointer
    Licence
    Apache-2.0
    Contexte serveur maximal
    8 192 tokens (état) + 8 192 tokens (par question)
    Contexte d'entraînement
    384 tokens (état), 1 024 tokens (état + question)
    Types de décision
    Binaire (noul), Choix multiple (1-255), Score ordinal (1-255)
    Tarification OpenRouter
    0,04 $ / M tokens (entrée), 0,00 $ / M tokens (sortie)

    Tarif annoncé : 0.04 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca