Texte

Tencent

Hy4

Tencent lance Hy4-preview, un modèle MoE de 770B de paramètres et 1M de tokens de contexte, axé sur l'ingénierie de précision et le raisonnement profond.

Dernière version
Tencent Hy4-preview
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Le 28 août 2026, Tencent a franchi une nouvelle étape dans le développement de ses grands modèles de langage en publiant les poids de Hy4-preview (nommé à l'international sous la marque Hunyuan). Succédant à Hy3-preview lancé quelques mois plus tôt en avril 2026, ce nouveau modèle phare s'impose comme une solution robuste, disponible au sein des outils de productivité de Tencent (comme WorkBuddy, CodeBuddy, Yuanbao et ima) et accessible pour les développeurs via Hugging Face, ModelScope, GitCode et CNB. Cette version bénéficie d'une licence Apache 2.0 et d'une variante quantifiée en FP8, facilitant grandement son intégration.

Une architecture Mixture-of-Experts (MoE) de grande envergure

Sur le plan technique, Hy4-preview repose sur une architecture de type Mixture-of-Experts (MoE) particulièrement sophistiquée. Le backbone du modèle comptabilise un total impressionnant de 770 milliards de paramètres, parmi lesquels 49 milliards sont activés par token.

Pour optimiser son efficacité, la structure comporte 78 couches, 256 experts routés et un expert partagé par couche MoE. À chaque token traité, le modèle sélectionne dynamiquement huit experts routés. De plus, Tencent intègre une couche de décodage spéculatif native appelée Multi-Token Prediction (MTP) de 10 milliards de paramètres (dont 0,7 milliard actifs) pour accélérer le traitement. L'architecture s'appuie également sur des technologies avancées comme la Gated DeepSeek Sparse Attention, IndexCache et iHC.

Capacités, raisonnement et gestion du contexte

Hy4-preview est conçu principalement pour les tâches d'instruction complexes et le raisonnement logique approfondi. Une de ses caractéristiques majeures est sa fenêtre de contexte gigantesque, atteignant 1 million de tokens. Bien que sa limite maximale de sortie reste non spécifiée officiellement, cette fenêtre d'entrée étendue ouvre la voie au traitement de bases de données et de documents massifs.

Le modèle propose deux modes de fonctionnement distincts selon les besoins de l'utilisateur : - Un mode de raisonnement profond, activé par défaut (mode high). - Un mode de réponse directe rapide (mode no_think), qui désactive le processus de réflexion détaillé.

L'écosystème autour du modèle prévoit également un parseur de raisonnement, un parseur d'appels d'outils (tool calling) et un mécanisme de sélection automatique d'outils intégré à des frameworks de service comme vLLM ou SGLang. Ces ajouts confirment la vocation agentique de Hy4-preview. Toutefois, il convient de préciser que la carte modèle actuelle classe Hy4-preview strictement sous la catégorie "Text Generation". À ce jour, aucune capacité native de traitement d'images, d'audio ou de vidéo n'est confirmée pour ce modèle.

Positionnement et performances comparatives

Le positionnement de Hy4-preview cible directement la productivité opérationnelle dans les domaines techniques et scientifiques. Lors d'évaluations internes menées par Tencent, un panel de 163 experts a évalué 203 tâches d'ingénierie complexe en aveugle. Sur une échelle de 4 points, Hy4-preview obtient une note de 2,99, devançant ainsi GLM-5.3 (2,92) et Kimi K3 (2,94). Bien que ces résultats soient compétitifs et prometteurs, ils doivent être interprétés avec prudence en l'absence de benchmarks indépendants et ouverts à la communauté globale.

Cas d'usage et limites d'utilisation

Le modèle est particulièrement adapté pour l'ingénierie logicielle sur des cycles longs (planification, débogage de code, vérification), l'analyse de documents complexes (génération de tableurs ou de présentations à partir de corpus d'informations volumineux) ainsi que le prototypage de jeux via des moteurs spécialisés.

Néanmoins, s'agissant d'une version précoce ("preview"), Tencent a identifié certaines limites notables. Hy4-preview a parfois tendance à raisonner plus longtemps que nécessaire sur des requêtes pourtant simples, et peut se perdre dans des processus de sur-vérification de ses propres résultats. Pour des applications critiques, un contrôle rigoureux des sorties, des calculs et des appels d'outils reste donc indispensable.

Au niveau de la tarification, le modèle est proposé sur OpenRouter au tarif de 0,834 $ par million de tokens en entrée et 2,501 $ par million de tokens en sortie. À titre d'information, les annonces tarifaires initiales de Tencent de 6 RMB (entrée) et 18 RMB (sortie) sur leur plateforme TokenHub doivent toujours être vérifiées avant tout déploiement commercial d'envergure.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Raisonnement

Peut enchaîner une réflexion prolongée avant de répondre, utile pour les tâches difficiles.

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Tencent Hy4-preview

    Dernière version

    tencent/hy4-preview

    OutilsRaisonnement
    Fenêtre de contexte
    1 000 000 jetons
    Fenêtre de contexte
    1 000 000 de tokens
    Architecture
    Mixture-of-Experts (770 Md de paramètres dont 49 Md actifs)
    Licence
    Apache 2.0
    Décodage spéculatif
    MTP natif (10 Md de paramètres dont 0,7 Md actifs)

    Tarif annoncé : 0.83 $ en entrée, 2.50 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca