Texte

Sakana

Fugu Max

Sakana AI lance Fugu Max, un orchestrateur multi-agents multimodal doté d'un contexte de 1M de tokens, alliant performances de pointe et maîtrise des coûts.

Dernière version
Sakana Fugu Max
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Un paradigme architectural fondé sur l'orchestration

Officialisé par Sakana AI le 11 septembre 2026, Fugu Max (sakana/fugu-max) adopte une approche singulière sur le marché des modèles de fondation. Contrairement aux modèles monolithiques traditionnels, Fugu Max se définit comme un orchestrateur appris. Son rôle consiste à analyser une requête complexe, à la décomposer et à déléguer l'exécution des sous-tâches à un ensemble prédéfini de modèles open-weight et spécialisés — incluant notamment des modèles de la famille NVIDIA Nemotron —, avant d'en agréger les résultats.

Le postulat de Sakana AI repose sur une recherche systématique d'efficience économique : plutôt que de mobiliser systématiquement un modèle massif au coût maximal, le système sélectionne la combinaison d'agents la plus sobre capable de résoudre l'instruction donnée. Ce positionnement vise directement la frontière de Pareto coût-performance, en proposant une alternative modulaire aux infrastructures traditionnelles.

Capacités techniques, modalités et gestion du contexte

Accessible via OpenRouter, Fugu Max se distingue par des spécifications dimensionnées pour les flux de travail exigeants :

  • Modalités d'entrée et de sortie : le modèle prend en charge le texte, les images ainsi que les documents volumineux tels que les PDF. Les réponses sont quant à elles exclusivement textuelles. Aucune modalité audio (en entrée ou en sortie) ni génération d'images n'est prise en charge.
  • Raisonnement modulable : le moteur intègre un mécanisme de raisonnement configurable selon trois intensités distinctes (high, xhigh et max), permettant d'ajuster l'effort de réflexion selon la complexité du problème.
  • Outillage et intégration logicielle : Fugu Max supporte nativement l'appel de fonctions (function calling), la génération de schémas JSON stricts (Structured Outputs), ainsi que des outils intégrés de recherche sur le web (web_search) et d'extraction de contenu (web_fetch). Côté interfaces, le système assure une compatibilité avec les formats OpenAI (Chat Completions et Responses) ainsi que l'API Messages d'Anthropic.
  • Fenêtre de contexte : le modèle dispose d'une mémoire de travail de 1 000 000 de tokens et autorise une génération maximale de 128 000 tokens en sortie. Fait notable, la tarification reste fixe sur l'ensemble de la fenêtre de contexte, sans palier de surcoût appliqué au-delà des 272 000 tokens.

Positionnement concurrentiel et performances annoncées

Les évaluations chiffrées émanent directement des publications de Sakana AI et doivent être appréhendées comme des métriques fournies par le concepteur sans audit indépendant tiers. Le laboratoire revendique la première place sur six bancs d'essai de référence : GPQA-D (95,5), Terminal Bench 2.1 (91,7), SWEFish (63,3 — un banc d'essai interne orienté développement logiciel), AutomationBench (49,5), ainsi que sur AA-LCR et GDP.pdf.

Face aux références fermées ou ouvertes comme Sonnet 5, GPT 5.6 Terra, Gemini 3.8 Flash, Kimi K3, Qwen3.8-max ou GLM-5.3, Sakana met en avant des performances comparables aux références haut de gamme pour un coût annoncé deux à six fois inférieur. Il convient toutefois de souligner qu'il s'agit d'une comparaison entre un méta-système multi-modèles et des modèles unitaires, sur la base de protocoles établis par l'éditeur.

Cas d'usage recommandés et limites opérationnelles

Fugu Max s'avère particulièrement pertinent pour les déploiements suivants : - Génie logiciel et revue de code : analyse de bases de code complexes, refactorisation et résolution de tickets logiciels. - Analyse documentaire à grande échelle : extraction, synthèse et recoupement d'informations à partir de volumineux fichiers PDF et d'images. - Workflows agentiques autonomes : exécution de scénarios multi-étapes combinant raisonnement approfondi, requêtes web ciblées et extraction de données structurées.

Néanmoins, plusieurs contraintes architecturales méritent votre attention : - Opacité du routage : le pool de modèles sous-jacent est fixe. Vous ne pouvez ni choisir les modèles délégués, ni en exclure certains. De surcroît, le système ne divulgue pas la liste exacte des modèles mobilisés ni la stratégie de routage appliquée pour une requête spécifique. - Imputation des tokens d'orchestration : les tokens générés de manière intermédiaire pour la coordination interne des agents sont facturés aux mêmes tarifs que les tokens de sortie visibles, ce qui peut accroître la facture finale sur les requêtes hautement interactives. - Outils web : chaque requête web_search ou web_fetch entraîne une facturation unitaire (0,007 $ par appel) susceptible de s'additionner rapidement lors d'investigations approfondies.

La grille tarifaire officielle s'établit à 2 $ par million de tokens en entrée, 6 $ par million de tokens en sortie, et 0,25 $ par million de tokens lus depuis le cache. Les appels aux outils web sont facturés 0,007 $ l'unité.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Vision

Analyse d'images fournies en entrée (photos, captures, documents visuels).

Fichiers

Peut s'appuyer sur des fichiers joints (documents, extraits) en plus du texte.

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Recherche web

Peut interroger le web pour appuyer une réponse sur des sources récentes.

Raisonnement

Peut enchaîner une réflexion prolongée avant de répondre, utile pour les tâches difficiles.

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Sakana Fugu Max

    Dernière version

    sakana/fugu-max

    VisionFichiersOutilsRecherche webRaisonnement
    Fenêtre de contexte
    1 000 000 jetons
    Sortie maximale
    128 000 jetons
    Fenêtre de contexte
    1 000 000 tokens
    Limite de sortie
    128 000 tokens
    Modalités d'entrée
    Texte, images, fichiers (PDF)
    Modalités de sortie
    Texte
    Architecture
    Orchestrateur appris multi-modèles
    Tarification entrée
    2,00 $ / M tokens
    Tarification sortie
    6,00 $ / M tokens

    Tarif annoncé : 2.00 $ en entrée, 6.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca