Claude Sonnet 5 : test, coûts et config multi-agents
Sonnet 5 coûte plus de 2 fois moins cher qu'Opus 4.8, et il le talonne sur presque tous les benchmarks. Si tu utilises Claude Code au quotidien, ça change concrètement la donne pour tes coûts d'agents IA.
Le problème jusqu'ici : Opus 4.8 à 30 dollars par million de tokens, c'était souvent overkill pour la majorité des tâches. Tu payais le prix fort pour du scrapping, de l'analyse de docs ou du coding standard. Et l'ancien Sonnet 4.6 ? Trop médiocre pour être une vraie alternative.
Sonnet 5 comble ce trou. Dans cet article, on va voir :
- Les benchmarks réels et où Sonnet 5 dépasse Opus
- Le piège du prix promotionnel et les coûts cachés
- L'architecture multi-agents concrète : Opus en orchestrateur, Sonnet 5 en tête chercheuse
- Un test live avec 3 instances en parallèle et les résultats visuels
- Les limites signalées par la communauté
Communauté gratuite
Rejoins +4 000 membres qui apprennent l'automatisation IA
Ressources, entraide et challenges hebdomadaires. 100% gratuit.
Rejoindre gratuitement →Combien coûte réellement Sonnet 5 vs Opus 4.8 ?
Le prix, c'est le premier truc qui saute aux yeux. Et c'est là que Sonnet 5 frappe fort.
Sorti le 30 juin 2026, Sonnet 5 est disponible immédiatement sur la web app Claude et sur Claude Code (après un claude update). Les chiffres bruts :
- Sonnet 5 : 2$ par million de tokens en entrée, 10$ en sortie. Total : 12$/M tokens
- Opus 4.8 : 30$/M tokens au total
- Résultat : Sonnet 5 est plus de 2,5 fois moins cher qu'Opus
Mais attention, il y a un piège. Ce prix de 12 dollars est promotionnel jusqu'au 31 août 2026. Après cette date, le tarif passe à 18 dollars par million de tokens. Ça reste nettement moins cher qu'Opus, mais l'écart se réduit.
Le piège des tokens en plus
Un détail que beaucoup vont ignorer : Sonnet 5 produit environ 30% de tokens en plus pour le même texte par rapport aux modèles précédents. Le prix au token est bas, mais le volume de tokens consommés est plus élevé. Le prix promo compense presque cette différence, mais après le 31 août, surveille ta facture réelle.
La sortie maximum est plafonnée à 128 000 tokens par réponse. C'est la fenêtre de contexte qui atteint 1 million de tokens. Concrètement, pour des tâches d'agents autonomes qui lisent beaucoup et produisent des sorties moyennes, c'est largement suffisant.
Quels benchmarks montrent que Sonnet 5 talonne Opus ?
Les chiffres sur le papier sont étonnants. Pas au point de rendre Opus inutile, mais suffisamment pour remettre en question la façon dont on répartit les tâches.
Coding et Terminal Bench
Sur le coding, Opus 4.8 garde une avance. Mais elle est mince :
- Terminal Bench : seulement 2 points d'écart entre Sonnet 5 et Opus 4.8
- Coding général : environ 5 à 6 points d'écart
- Sonnet 5 atteint 80% sur Terminal Bench, le plus gros saut par rapport aux anciens modèles Sonnet
Pour le coding le plus dur, Opus garde environ 6 points d'avance. Il reste le meilleur sur le papier. Mais pour du coding standard en sous-agent, ces 6 points ne justifient pas de payer 2,5 fois plus cher.
Mémoire de travail et connaissance
Et c'est là que ça devient intéressant. Sur le benchmark GDPVAL (mémoire de travail), Sonnet 5 score à 1618. Il dépasse Opus 4.8. C'est un résultat inattendu pour un modèle de cette gamme de prix.
Pour le travail de connaissance (analyse de documents, tableurs, rapports), Sonnet 5 est meilleur qu'Opus. Du jamais vu à ce prix. C'est contre-intuitif parce que le réflexe naturel, c'est de prendre le modèle le plus cher pour les tâches de connaissance. Mais les benchmarks disent le contraire.
Performance agentique et Computer Use
Sur les benchmarks de recherche d'agents et d'utilisation de l'ordinateur (Computer Use), le tableau est nuancé :
- Opus reste au-dessus en taux de réussite (pass rate) pour le travail agentique lourd
- Mais Sonnet 5 démarre à 72% de pass rate pour un coût de 20 centimes par tâche
- Par rapport à Sonnet 4.6, le saut est massif en performance comme en rapport qualité-prix
Concrètement : si tu as une tâche agentique légère qui n'a pas besoin d'un gros modèle, Sonnet 5 en effort low te donne un pass rate de 72% pour quelques centimes. C'est un nouveau terrain de jeu.
Comment configurer Sonnet 5 en architecture multi-agents sur Claude Code ?
L'intérêt principal de Sonnet 5 n'est pas de remplacer Opus. C'est de le libérer. L'idée : Opus fait le travail stratégique, Sonnet 5 fait le sale boulot. Voici l'architecture concrète.
La pyramide : orchestrateur, workers, superviseur
L'architecture se décompose en trois couches :
- Opus 4.8 en orchestrateur : il garde la vision d'ensemble, planifie la répartition des tâches, gère la cohérence entre les lots. C'est lui qui décide quel sous-agent fait quoi et avec quelle énergie.
- Sonnet 5 en têtes chercheuses : les workers. Scrapping, analyse, code, rédaction, extraction. Ils travaillent en parallèle, chacun sur sa tâche.
- Opus 4.8 en superviseur (optionnel, à tester) : un second Opus qui fait la revue qualité de la sortie finale. L'orchestrateur envoie le travail, le superviseur vérifie le produit fini.
L'analogie est simple : l'orchestrateur, c'est le chef de projet à 300 points de QI. Les sous-agents Sonnet 5, ce sont des spécialistes à 200 points de QI envoyés sur le terrain. Et le résultat : 5 sous-agents Sonnet 5 en parallèle coûtent souvent moins cher qu'un seul Opus qui ferait tout en série. En plus, ça va beaucoup plus vite.
La configuration dans settings.json
La mise en place est simple. Une seule ligne dans ton fichier de configuration :
claude_code_sub_agent_model: claude-sonnet-5
Avec cette ligne, tous les sous-agents invoqués automatiquement utiliseront Sonnet 5. Le modèle principal reste sur Opus 4.8. Quand Claude Code décide qu'une tâche peut être parallélisée, il envoie des Sonnet 5. Quand c'est du travail linéaire, il reste sur le modèle principal.
Pour le niveau d'effort, le réglage par défaut recommandé est x-high. Mais c'est à tester selon tes tâches. Certains retours de développeurs sur Reddit suggèrent que poussé au max, Sonnet 5 peut coûter plus cher qu'Opus. Pour le meilleur rapport qualité-prix en sous-agent, les niveaux low ou medium méritent d'être testés.
Tutoriels vidéo
Apprends l'IA et l'automatisation en vidéo sur YouTube
Démos live, tutoriels pas à pas et cas d'usage concrets. +28K abonnés.
Voir les tutoriels →Qu'est-ce que donne le test avec 3 instances en parallèle ?
Les benchmarks, c'est bien. Un test réel, c'est mieux. L'idée : lancer le même prompt dans 3 instances Sonnet 5 en parallèle et comparer les résultats. Une tâche simple et accessible : créer une landing page de conciergerie de luxe.
Le prompt et les conditions
Le prompt demandait une landing page complète pour "Luxury Houses", une conciergerie privée d'achat de résidences haut de gamme. Les spécifications :
- Un héros avec promesse forte et sous-titre
- Des chiffres clés de confiance
- Le service en N étapes
- Des biens d'exception avec accès off-market
- Des témoignages anonymisés et un formulaire de contact
- Design premier, beaucoup d'air, belle typographie
- Livraison en un seul fichier index.html, responsive mobile-first
- Copie en vrai français, pas de lorem ipsum
Les 3 instances étaient configurées en Sonnet 5, effort x-high. Le même prompt envoyé à environ 5 secondes d'intervalle.
Les résultats concrets
Temps d'exécution : 6 minutes par instance, configuration incluse (chargement de skill front-end, lecture de la config). Avec Opus, la même tâche aurait pris environ 10 minutes.
Et la divergence entre les 3 résultats était massive :
- Test 1 : le meilleur. Direction artistique "art déco nocturne" (noir, vert profond, ivoire chaud, laiton mat). Il a défini explicitement sa direction avant de coder. Favicon inclus. Header sticky avec animation au scroll. Animations d'apparition au défilement. Résultat qualifié de "prêt à déployer en production".
- Test 2 : résultat correct mais moins élaboré. Il a foncé directement dans le code sans poser de direction artistique. Moins de finitions visuelles.
- Test 3 : original avec un curseur personnalisé (cercle sur la souris) et un menu sticky propre. Cohérent mais différent du test 1.
Le point important : les deux premiers terminés étaient nettement moins bons que celui qui a pris le temps de réfléchir à sa direction. Et ça change tout dans la méthodologie de travail. Lancer plusieurs instances et comparer, c'est essentiel. Un seul résultat peut te faire croire que le modèle est nul alors qu'en relançant, tu obtiens quelque chose d'excellent.
Pour rappel, les anciens modèles Sonnet (4.6 et avant) produisaient des résultats catastrophiques sur ce type de tâche comparés à Opus. Là, le test 1 de Sonnet 5 rivalise avec ce qu'Opus aurait produit. En 6 minutes. Pour beaucoup moins cher.
Sur quelles tâches Sonnet 5 va-t-il briller concrètement ?
Une matrice simple pour savoir quand utiliser quoi. Deux axes : le niveau de raisonnement requis et le volume de travail.
La matrice de répartition des modèles
- Opus 4.8 : raisonnement fort, volume faible. L'orchestrateur, le superviseur, la planification stratégique. Le chef de projet qui réfléchit mais ne pose pas les briques.
- Sonnet 5 : pile au milieu. Raisonnement solide, volume modéré à élevé. Le modèle le plus "antifragile" de la gamme. Il s'adapte à presque tout.
- Haiku 4.5 : raisonnement léger, volume massif. La routine pure. Même si en pratique, un DeepSeek Flash à 10 à 30 fois moins cher fait souvent mieux.
Les chantiers où Sonnet 5 excelle
Concrètement, voici les cas d'usage où Sonnet 5 apporte le meilleur retour sur investissement :
- Agents autonomes : planification, navigation (navigateur et terminal), accomplissement de tâches longues
- Coding agent : Terminal Bench monté à 80%, le plus gros saut de la gamme Sonnet
- Scrapping et extraction : pour quelqu'un qui fait un scrapping par semaine avec un abonnement Claude à 200 dollars, inutile de monter une architecture complexe avec des modèles chinois. Sonnet 5 sur Claude Code suffit largement.
- Travail de connaissance : analyse de docs, tableurs, rapports. C'est là où il dépasse Opus. Division du coût par plus de deux pour ces tâches.
- Agent loops : tu donnes un objectif, il essaie, teste, améliore en boucle avant de rendre. Compatible avec des workflows comme RalphLoop pour des développements overnight.
Le parallélisme massif devient abordable. 5 sous-agents Sonnet 5 qui travaillent simultanément coûtent moins qu'un seul Opus en série. Et c'est plus rapide. Pour ceux qui trouvent Claude Code lent par rapport à Codex, c'est une vraie réponse.
Quelles sont les limites et les points de vigilance ?
Sonnet 5 n'est pas magique. Il a des faiblesses documentées et quelques zones d'ombre à surveiller.
Le benchmark de comportement mal aligné
L'audit comportemental automatisé d'Anthropic mesure les comportements indésirables dans divers contextes. Les résultats pour Sonnet 5 :
- Mieux que Sonnet 4.6 : moins de comportements non conformes
- Moins bon qu'Opus 4.8 et Mythos : les barres sont plus hautes
En pratique : tu peux lui faire plus confiance qu'à l'ancien Sonnet, mais garde une supervision pour les tâches critiques. C'est un argument de plus pour l'architecture pyramidale avec Opus en superviseur.
La revue de code, point faible signalé
Sur Reddit, GitHub et les forums de développeurs (avec le biais habituel : le modèle a moins de 24h), le retour le plus fréquent concerne la revue de code. Sonnet 5 ne serait pas très bon pour relire et corriger son propre travail.
Deux solutions :
- Faire la revue avec Opus 4.8 : une passe qui remonte toutes les incertitudes, puis relance pour chercher les bugs manqués
- Utiliser Codex en revue adversariale : Claude Code pour la production, ChatGPT Codex pour la revue. Deux regards différents sur le même code.
Le piège du niveau d'effort max
Sonnet 5 propose les mêmes niveaux d'effort que les autres modèles Claude : faible, moyen, élevé, extra, max. Le réflexe de beaucoup d'utilisateurs, c'est de rester en x-high ou max sans se poser la question.
Les premiers retours indiquent que poussé au max, Sonnet 5 peut coûter plus cher qu'Opus. Le meilleur rapport qualité-prix serait en low ou medium. Pour 99% des tâches courantes, ça suffit probablement. Ça coûte moins cher et c'est plus rapide. À tester selon tes cas d'usage.
Que retenir de Sonnet 5 pour ta stack IA ?
Si tu utilises Claude Code quotidiennement, Sonnet 5 change la structure de tes coûts. Ce n'est pas un remplacement d'Opus. C'est un complément qui rend le multi-agents abordable.
Les points clés à retenir :
- Prix : 12$/M tokens jusqu'au 31 août, puis 18$. Contre 30$ pour Opus. Mais attention au +30% de tokens produits.
- Benchmarks : talonne Opus en coding (2 à 6 points d'écart), le dépasse en mémoire de travail et travail de connaissance.
- Architecture optimale : Opus orchestrateur + Sonnet 5 workers en parallèle + Opus superviseur en sortie.
- Config : une ligne dans settings.json,
claude_code_sub_agent_model: claude-sonnet-5. - Limites : revue de code faible, comportement moins aligné qu'Opus, coût potentiellement élevé en effort max.
- Prochaine étape : profiter du prix promo jusqu'au 31 août pour alimenter tes agents et calibrer tes niveaux d'effort.
Le parallélisme massif devient abordable. 5 agents Sonnet 5 en parallèle coûtent moins cher qu'un seul Opus en série, et le travail est fait plus vite. Pour la veille, le scrapping, l'extraction, l'analyse de docs : c'est le nouveau moteur de tes agents.
En attendant un éventuel Fable 5 ou Haiku 5 qui rebattrait encore les cartes, Sonnet 5 est la mise à jour qui compte en ce début juillet 2026.
Passe à l'action avec un accompagnement concret
Rejoins LE LABO IA : formation premium Vibe Coding + Automatisation IA avec coaching personnalisé.
Découvrir l'accompagnement →Questions fréquentes
Pas complètement. Opus 4.8 garde environ 6 points d'avance sur les benchmarks de coding les plus exigeants. Pour les tâches de développement complexes, Opus reste le meilleur choix en orchestrateur ou superviseur. Par contre, pour du coding standard en sous-agent, Sonnet 5 est largement suffisant et coûte plus de deux fois moins cher.
Jusqu'au 31 août 2026, Sonnet 5 coûte 12 dollars par million de tokens (2$ en entrée, 10$ en sortie). Opus 4.8 est à 30 dollars. Sonnet 5 est donc plus de 2 fois moins cher. Attention : après le 31 août, le prix monte à 18 dollars. Et un piège important : Sonnet 5 produit environ 30% de tokens en plus pour le même texte, ce qui réduit un peu l'écart réel.
Pour la plupart des tâches, commencer en x-high est un bon point de départ. Cela dit, des premiers retours sur Reddit indiquent que poussé au max, Sonnet 5 peut coûter plus cher qu'Opus. Pour le meilleur rapport qualité-prix, teste les niveaux low ou medium : pour 99% des tâches courantes, ça peut suffire largement et coûtera bien moins cher.
Il suffit d'ajouter la ligne claude_code_sub_agent_model: claude-sonnet-5 dans ton fichier settings.json. De cette façon, tous les sous-agents invoqués automatiquement utiliseront Sonnet 5 pendant que ton orchestrateur principal reste sur Opus 4.8. La configuration est simple et immédiate après la mise à jour de Claude Code.
Sur le benchmark de comportement mal aligné, Sonnet 5 fait mieux que Sonnet 4.6 mais reste en dessous d'Opus 4.8 et Mythos. Il est donc préférable de garder une couche de supervision, surtout pour les tâches critiques. Le point faible signalé par la communauté concerne la revue de code : il n'est pas encore très bon pour détecter ses propres erreurs. Une revue adversariale avec Opus ou Codex reste recommandée.
Sonnet 5 surpasse Opus 4.8 sur le travail de connaissance : analyse de documents, tableurs, rapports. Il le dépasse aussi sur le benchmark de mémoire de travail GDPVAL avec un score de 1618 contre Opus. Pour le scrapping, l'extraction de données et les agents loops, il offre un rapport performance-prix inédit. Seul le coding très complexe reste l'avantage d'Opus.