Sakana Fugu : l'orchestrateur IA japonais qui commande tous les modèles
Un labo japonais valorisé 2,65 milliards de dollars vient de sortir un modèle qui prétend battre Opus 4.8, GPT 5.5 et Gemini 3.1 Pro sur la quasi-totalité des benchmarks. Le truc, c'est que Sakana Fugu n'est pas un modèle de plus. C'est un orchestrateur : une IA qui commande d'autres IA pour produire de meilleurs résultats.
Au lieu de miser sur un seul modèle toujours plus gros, Sakana prend le pari inverse. Coordonner plusieurs modèles existants comme un banc de poissons, où le groupe fait mieux que chaque individu seul. Le problème c'est que les scores viennent de Sakana eux-mêmes, le service n'est pas disponible en Europe, et il y a des nuances importantes à comprendre avant de s'emballer.
Dans cet article, on va décortiquer :
- Comment fonctionne réellement l'orchestration de Fugu (et la différence entre Fugu et Fugu Ultra)
- Qui est derrière Sakana AI et pourquoi c'est crédible
- Ce que disent les benchmarks, et pourquoi il faut les prendre avec des pincettes
- Les limites concrètes : souveraineté, disponibilité, open source (spoiler : ce n'est pas le cas)
- Combien ça coûte et si ça vaut le coup pour ton activité
Communauté gratuite
Rejoins +4 000 membres qui apprennent l'automatisation IA
Ressources, entraide et challenges hebdomadaires. 100% gratuit.
Rejoindre gratuitement →Qui est Sakana AI et pourquoi c'est sérieux ?
On ne parle pas d'une startup sortie de nulle part. Sakana AI a été fondé en 2023 à Tokyo par David Ha et Llion Jones. Ce dernier nom devrait te dire quelque chose : il est le co-auteur du Transformer, l'architecture qui est à la base de tous les LLM actuels. ChatGPT, Claude, Gemini : tout repose sur cette architecture.
La valorisation actuelle : 2,65 milliards de dollars. Ce n'est pas un projet hobby.
Leur thèse, écrite noir sur blanc depuis 2023 : l'intelligence peut émerger d'un groupe de modèles coordonnés, exactement comme un banc de poissons fait mieux que chaque poisson individuellement. D'où le nom "Fugu" (poisson-globe en japonais).
Ce qui est intéressant, c'est la position géopolitique. On a les États-Unis avec OpenAI, Anthropic, Google, XAI. La Chine avec DeepSeek, Qwen, et beaucoup d'autres. L'Europe... on n'en parle pas. Et le Japon : pour l'instant, Sakana. Peut-être que c'est leur stratégie. Moins de volume, plus de qualité. Un peu comme la cuisine japonaise, finalement.
Comment fonctionne concrètement l'orchestration de Fugu ?
L'idée est simple sur le papier. Tu envoies ton prompt, et un "chef" Fugu analyse ta demande pour décider quels modèles activer. Il ne génère pas la réponse lui-même. Il distribue le travail.
Concrètement, il y a deux modes de fonctionnement :
Fugu standard : le routeur intelligent
Tu poses une question. Fugu analyse la nature de la tâche et route vers un seul modèle qu'il juge le meilleur pour cette demande précise. GPT 5.5 pour du calcul, Opus 4.8 pour du débogage, Gemini 3.1 Pro pour de la chimie. C'est rapide et pensé pour le quotidien.
Fugu Ultra : l'équipe complète
Là, c'est plus ambitieux. Fugu Ultra va :
- Découper ton problème en sous-tâches
- Distribuer chaque sous-tâche au modèle le plus adapté
- Vérifier : un modèle relit le travail des autres et corrige les erreurs
- Synthétiser : assembler le tout en une réponse cohérente
L'analogie de l'équipe de foot est parlante. Chaque joueur a ses forces : un bon tireur, un bon passeur, un bon défenseur. Fugu Ultra est l'entraîneur qui compose l'équipe en fonction du match.
Le modèle porte trois casquettes : le penseur (stratégie et plan d'attaque), l'ouvrier (exécution des sous-tâches) et le vérificateur (relecture et correction). Si tu utilises Claude Code et Codex en parallèle, tu fais déjà ça manuellement. L'un trouve des bugs que l'autre rate, et inversement. Fugu automatise cette approche.
La vraie nouveauté : l'apprentissage du routage
Ce qui distingue Fugu des orchestrateurs qu'on codait sur N8N en 2024-2025, c'est que le routage n'est pas écrit à la main. C'est un modèle entraîné à coordonner. Fugu apprend les spécialités de chaque modèle au fur et à mesure de son utilisation. Il ne se contente pas de savoir que "GPT est bon en maths". Il va potentiellement distinguer que GPT 5.5 excelle sur les équations différentielles tandis que Opus 4.8 est meilleur en division complexe.
La base scientifique repose sur deux papiers présentés à ICLR 2026 (l'une des grandes conférences de recherche IA) : Trinity, un coordinateur de 0,6 milliard de paramètres, et Conductor, un orchestrateur entraîné par renforcement. Les deux sont disponibles sur ARXIV avec leur code.
Que disent les benchmarks et peut-on leur faire confiance ?
Sur le papier, les chiffres sont impressionnants. Voici ce qui ressort du rapport technique publié le 24 juin 2026 :
- SWE Bench (test de code réel) : Fugu Ultra à 73,7 points, contre 58,6 pour GPT 5.5 et au-dessus d'Opus 4.8 et Gemini 3.1 Pro
- Fugu Ultra surpasse Mythos Preview, Gemini 3.1 Pro et Opus 4.8 sur la majorité des critères testés (terminal, live code, questions-réponses, etc.)
- Seul Fable 5, dont l'accès a été coupé en Europe, le dépasse avec 80 points au SWE Bench, soit un écart de 6,3 points
Un détail amusant : ils ont aussi benchmarké Fugu sur des parties d'échecs contre Stockfish à 2100 ELO. Fugu a gagné 4 parties, avec des graphiques montrant la probabilité de victoire qui explose à certains coups clés. C'est spectaculaire. Mais rien ne dit qu'ils n'ont pas joué 50 parties et sélectionné les 4 meilleures.
Et c'est là le point crucial : tous ces chiffres viennent de Sakana. Aucun laboratoire tiers indépendant ne les a audités. On ne peut pas simplement lire des benchmarks auto-publiés et en conclure que c'est la meilleure solution du marché. Il faut du test en conditions réelles, sur des cas d'usage professionnels, sur plusieurs semaines. Pas un test de 2 heures pour faire une vidéo YouTube.
Tutoriels vidéo
Apprends l'IA et l'automatisation en vidéo sur YouTube
Démos live, tutoriels pas à pas et cas d'usage concrets. +28K abonnés.
Voir les tutoriels →Pourquoi l'orchestration multi-modèles n'est pas une mode passagère ?
On pourrait se dire : encore un nouvel outil, encore du hype. Sauf que l'orchestration, ce n'est pas nouveau. C'est probablement le concept le plus intemporel depuis le début de l'IA grand public.
En 2022-2023, on avait déjà BabyAGI et AutoGPT. C'était de l'orchestration basique, mais le principe était là. Aujourd'hui, avec Claude Code, Gemini CLI ou Codex, on fait la même chose en 10 000 fois mieux. Dans LE LABO IA, les membres qui utilisent des orchestrateurs multi-LLM depuis des mois voient une différence flagrante dans la qualité des réponses.
Le raisonnement est logique : chaque modèle a un entraînement différent. Des embeddings différents. Des nuages de points sémantiques différents. Le mot "chat" n'a pas exactement la même position dans l'espace vectoriel de GPT 5.5 et de Gemini 3.1 Pro. Donc quand tu fais intervenir plusieurs modèles sur la même question et que tu synthétises les réponses, tu récupères :
- Le consensus entre les modèles (ce sur quoi ils sont d'accord)
- Les divergences (ce qu'un modèle voit et pas l'autre)
- Une couverture plus large du problème
Même en mettant Fable 5 ou Fable 17 seul, la diversité de 50 modèles combinés produira quelque chose de plus riche. Ce n'est pas magique. C'est mathématique.
Quelles sont les vraies limites de Sakana Fugu ?
Le tableau n'est pas tout rose. Il y a plusieurs points qui méritent ton attention avant de foncer tête baissée.
Pas disponible en Europe
Premier écran sur leur page de vente : "Service non disponible dans votre région." Pas de RGPD, pas d'accès. UK pareil. La Suisse pareil. Un VPN contourne le problème, mais ce n'est pas une solution sérieuse pour un usage professionnel.
Ce n'est pas open source
Beaucoup pensent que Fugu est un modèle ouvert téléchargeable. En réalité :
- Aucun poids de modèle n'est public
- Pas d'auto-hébergement possible
- Le système de routage reste secret (c'est leur avantage concurrentiel)
La dépendance aux géants américains
Fugu orchestre des modèles existants : Opus, GPT, Gemini. Il loue son intelligence aux mêmes géants américains qu'il prétend contourner. Si tu retires ces modèles puissants de sa pool, il perd sa force. C'est logique, mais ça relativise l'argument de souveraineté.
Plafonné par sa pool de modèles
Un orchestrateur ne peut pas dépasser le meilleur de ses composants sur une tâche isolée. Il les combine, il les optimise, mais il ne crée pas de capacités qui n'existent pas. Si Fable 5 est à 80 au SWE Bench et qu'il n'est pas dans la pool, Fugu Ultra plafonne en dessous.
Plus lent et plus cher
Faire intervenir plusieurs modèles, vérifier, synthétiser : ça prend du temps et ça coûte des tokens. Mais "plus cher" est relatif. Si tu réussis un projet en 3 heures au lieu de 12, le surcoût en tokens est dérisoire.
Données sensibles
Si tu es avocat, fiscaliste, ou que tu travailles avec des données confidentielles, tes prompts transitent par Sakana puis par les providers de modèles. Pas idéal pour de la donnée sensible. Et ce n'est pas un cas marginal : même un coach avec une méthode propriétaire peut ne pas vouloir faire passer ses contenus dans un pipeline multi-LLM.
Combien ça coûte et comment y accéder ?
Deux modes de facturation disponibles :
Abonnement mensuel
- Standard : 20 $/mois
- Pro : 100 $/mois
- Max : 200 $/mois
C'est le même palier de prix que Claude. Standard pour tester, Pro pour un usage régulier, Max pour de la production intensive.
Pay-as-you-go (API)
- 5 $ par million de tokens en entrée
- 30 $ par million de tokens en sortie
Pour comparaison, Claude Opus 4.8 est à 5 $ en entrée et 25 $ en sortie. Fugu coûte donc 5 $ de plus par million de tokens en sortie. Un surcoût modeste si la qualité suit.
Disponibilité sur OpenRouter
Le modèle Ultra est déjà présent sur OpenRouter. Les applications qui l'utilisent le plus en production : Hermes en top 1, suivi de Cursor, OpenClose et Codex. Le fait qu'Hermes soit en tête et pas en 5e position montre que ce n'est pas que du hype YouTube. C'est utilisé en production.
Pourquoi le timing de ce lancement n'est probablement pas une coïncidence ?
Le 12 juin 2026, les États-Unis coupent l'accès à Fable 5 et Mythos 5 pour l'Europe. 10 jours plus tard, Sakana sort Fugu. Bien sûr, ils travaillaient dessus depuis des mois, voire des années. Mais le timing est intéressant.
On vit un point de bascule. Dans LE LABO IA, de plus en plus de membres réalisent la fragilité de dépendre d'un seul provider. Demain, Anthropic peut fermer. OpenAI peut bloquer ta région. Et si tu n'as pas mis en place d'orchestration multi-modèles, tu te retrouves sans rien.
C'est d'ailleurs l'argument central de Sakana sur leur page de vente : "Si un fournisseur te coupe l'accès du jour au lendemain, un système qui jongle entre plusieurs modèles continue de tourner." Les membres qui utilisent des passerelles comme OpenRouter, qui font intervenir plusieurs IA en parallèle, sont beaucoup moins fragiles que ceux qui dépendent d'un modèle unique.
L'orchestration n'est pas l'avenir. C'est déjà le présent depuis 2023. Sakana en fait juste un produit clé en main, et c'est là que réside la valeur potentielle.
Passe à l'action avec un accompagnement concret
Rejoins LE LABO IA : formation premium Vibe Coding + Automatisation IA avec coaching personnalisé.
Découvrir l'accompagnement →Questions fréquentes
Non, pas encore. Dès la page d'accueil, Sakana indique que le service n'est pas disponible en Union Européenne ni au Royaume-Uni. Ils travaillent sur la conformité RGPD. Un VPN peut contourner la restriction, mais ce n'est pas une solution pérenne pour un usage professionnel.
Fugu standard route ta requête vers un seul modèle qu'il juge le plus adapté. C'est rapide et pensé pour les tâches quotidiennes. Fugu Ultra découpe ton problème en sous-tâches, les distribue à plusieurs modèles, vérifie les résultats et synthétise le tout. C'est plus lent et plus cher, mais conçu pour les problèmes complexes.
Non. Malgré les apparences, aucun poids de modèle n'est public, il n'y a pas d'auto-hébergement possible et le système de routage reste propriétaire. Les papiers de recherche (Trinity et Conductor) sont accessibles sur ARXIV, mais le produit lui-même est fermé.
Deux options : abonnement à 20, 100 ou 200 dollars par mois (Standard, Pro, Max), ou pay-as-you-go via API à 5 dollars par million de tokens en entrée et 30 dollars en sortie. C'est environ 5 dollars de plus par million de tokens en sortie que Claude Opus 4.8.
Les scores viennent exclusivement de Sakana. Aucun laboratoire tiers indépendant ne les a audités à ce jour. Sur le SWE Bench, Fugu Ultra affiche 73,7 points contre 58,6 pour GPT 5.5, ce qui est impressionnant. Mais tant qu'il n'y a pas de validation externe et de tests en conditions réelles prolongés, il faut rester prudent.
Pas directement. Fugu est un orchestrateur qui se place au-dessus des modèles, pas un IDE ou un assistant de code en soi. Il peut améliorer la qualité des réponses en combinant plusieurs modèles, mais tu auras toujours besoin de tes outils de développement. Il est d'ailleurs déjà utilisé sur Cursor et Codex via OpenRouter.