Fugu fait travailler plusieurs modèles au prix d’une seule API

Sakana AI lance Fugu Max et Fugu Ultra v2, deux configurations multi-agents qui répartissent les tâches entre plusieurs modèles afin de privilégier le coût ou la qualité.

Une même requête peut nécessiter un raisonnement difficile, une recherche documentaire, l’écriture de code puis sa vérification. Sakana AI ne cherche plus à confier toutes ces étapes au même modèle. Avec Fugu Max et Fugu Ultra v2, l’entreprise japonaise veut sélectionner plusieurs spécialistes, organiser leur travail et présenter leur résultat derrière une seule API.

Annoncés le 11 septembre 2026, ces deux services ne sont donc pas de nouveaux modèles de fondation entraînés depuis le départ. Ils constituent deux configurations du système Fugu, une couche d’orchestration capable d’attribuer des rôles à différents modèles, de leur transmettre les productions des autres participants et de modifier la composition du groupe selon la tâche.

Pour l’utilisateur, cette organisation reste en grande partie invisible. Une application envoie sa demande à une interface compatible avec le format d’OpenAI et reçoit une réponse unifiée. Elle n’a pas à appeler elle-même chaque fournisseur, à répartir les étapes ou à réconcilier plusieurs sorties.

À l’intérieur, le fonctionnement peut pourtant s’éloigner fortement d’une requête traditionnelle. Un modèle peut proposer une stratégie, un autre exécuter une partie du travail et un troisième vérifier le résultat. Plusieurs échanges peuvent être nécessaires avant la production de la réponse finale. La composition et l’ordre des interventions ne suivent pas obligatoirement un scénario identique pour toutes les demandes.

Cette approche s’appuie sur deux travaux antérieurs de Sakana AI. TRINITY utilise un coordonnateur compact dont la structure a été obtenue par évolution automatique. Il distribue notamment les fonctions de réflexion, d’exécution et de vérification entre différents modèles.

Conductor explore une autre méthode. Le coordonnateur apprend par renforcement à formuler en langage naturel les instructions adressées aux autres agents. Il peut également se sélectionner lui-même comme participant, ce qui autorise des organisations récursives et davantage de calcul lorsque la difficulté le justifie.

Fugu transforme ces recherches en service. Au lieu de demander au client de choisir entre plusieurs modèles dans une liste statique, Sakana AI tente de prendre cette décision pendant l’exécution. Une tâche simple doit pouvoir être envoyée vers une ressource moins coûteuse, tandis qu’un problème complexe peut mobiliser une équipe plus large.

Fugu Max et Fugu Ultra v2 utilisent la même architecture générale, mais ne poursuivent pas exactement le même objectif. Max cherche le meilleur compromis entre qualité et prix. Ultra v2 privilégie la qualité finale, quitte à solliciter davantage d’agents et à allonger le temps de réponse.

Sakana AI présente cette différence à travers la notion de frontière de Pareto. Un système se trouve sur cette frontière lorsqu’aucun concurrent ne peut simultanément fournir de meilleurs résultats et coûter moins cher. Améliorer la qualité à prix égal ou réduire le prix sans perdre en qualité revient à déplacer cette frontière.

Fugu Max doit l’étendre du côté de l’efficacité. Il utilise le plus grand ensemble de modèles jamais intégré à Fugu, avec des systèmes ouverts ou spécialisés, dont plusieurs membres de la famille Nemotron de NVIDIA. Le service cherche dynamiquement la combinaison jugée suffisante pour traiter chaque demande.

Cette sélection ne signifie pas que l’utilisateur peut consulter à l’avance le nom de chaque participant. Sakana AI ne publie pas la composition exhaustive du pool de Max ni le chemin précis suivi par chaque requête. Le terme « modèles ouverts » ne garantit pas non plus que l’ensemble des composants possède des poids téléchargeables.

La société attribue à Max le meilleur résultat général sur six évaluations : Terminal-Bench 2.1, GPQA Diamond, AA-LCR, GDP.pdf, AutomationBench et SWEFish. Cette dernière est une évaluation interne fondée sur les propres travaux de programmation de Sakana AI.

Elle affirme également que Max étend la frontière coût-performance sur sept des dix tests présentés. Ses résultats se situeraient à proximité de ceux des meilleurs modèles individuels pour un prix deux à six fois inférieur, selon le concurrent et l’évaluation retenus.

Cette promesse repose en partie sur un tarif de 2 dollars par million de tokens en entrée et de 6 dollars en sortie. Les entrées déjà en cache coûtent 0,25 dollar par million. La recherche et la récupération de pages web sont facturées séparément, à raison de 0,007 dollar par appel.

Sakana AI compare notamment les 6 dollars facturés en sortie aux prix de Sonnet 5, GPT-5.6 Terra et Kimi K3, qu’elle présente comme supérieurs de 40 à 60 %. Cette comparaison porte sur les tarifs unitaires affichés. Elle ne suffit pas à prévoir le coût d’une tâche entière, dont la longueur, le nombre d’étapes et les appels d’outils peuvent varier d’un système à l’autre.

L’entreprise précise qu’elle n’additionne pas plusieurs tarifs lorsque plusieurs agents participent. Le client paie un taux unique correspondant à la formule utilisée ou, pour le service Fugu standard, au modèle de niveau le plus élevé présent dans le pool. Cette règle simplifie la facture, mais ne permet pas de connaître la quantité de calcul réellement consommée derrière chaque réponse.

Fugu Ultra v2 suit la direction opposée. Il coordonne un groupe plus profond de spécialistes afin de maximiser la qualité sur les recherches autonomes, les raisonnements en plusieurs étapes et le développement logiciel complet. Sakana AI reconnaît que cette organisation augmente le temps de réponse.

Son résultat le plus spectaculaire concerne Chartography, une évaluation portant sur l’interprétation de graphiques et de données structurées. Ultra v2 y obtient 48,3 points, contre 29,5 pour Fable 5 et 27,3 pour Opus 5 dans le tableau de son fournisseur.

Sur DeepSWE, consacré à des tâches de développement logiciel, son score atteint 74,3. Sakana AI affirme qu’il dépasse ainsi des modèles coûtant trois à cinq fois plus cher par token. Ultra v2 arriverait