Anthropic publie une évaluation des capacités cyber de GLM-5.3 : 50 exploits réussis sur 410 essais et garde-fous contournés dans 64 à 100 % des cas
Selon Anthropic, qui publie une évaluation du modèle à poids ouverts GLM-5.3 de Zai, ce dernier a produit un exploit navigateur fonctionnel de bout en bout dans 50 essais sur 410 sur le banc d'essai ExploitBench, contre 56 pour Claude Mythos Preview, un modèle réservé à des utilisateurs vérifiés, alors que la génération précédente (Claude Opus 4.6 et GLM-5.2) restait à 0 %. D'après l'éditeur, les tentatives de contournement des garde-fous de GLM-5.3 aboutissent dans 64 à 100 % des cas selon la méthode employée, et le retrait des refus directement dans les poids aurait demandé environ 2 200 heures GPU, soit environ 4 400 dollars. Ces éléments sont rapportés par Anthropic, qui publie ses propres modèles concurrents, et ne sont pas confirmés de façon indépendante ici.
Ce que ça change pour toi
Pour toi, la conséquence pratique est double. Côté défense, traite les garde-fous d'un modèle à poids ouverts comme une barrière que tu ne contrôles pas : si tu intègres ce type de modèle dans un produit ou un agent, place la modération dans ta couche applicative, avec filtrage des entrées, restriction des outils, bac à sable et journalisation. Côté exposition, l'hypothèse de travail raisonnable est que des capacités d'exploitation automatisée circulent plus largement : applique tes mises à jour navigateur et dépendances sans délai, réduis les services exposés et vérifie que tes secrets ne traînent pas dans un dépôt ou un historique de prompts. Rien dans ce rapport ne t'oblige à changer d'outil aujourd'hui, mais il justifie de revoir tes bases avant d'ajouter une brique de sécurité IA.
1 seule source : information à recouper avant de s’y fier.
Anthropic a publié une évaluation du modèle à poids ouverts GLM-5.3 de Zai. Sur ExploitBench, GLM-5.3 a produit un exploit navigateur fonctionnel dans 50 essais sur 410, contre 56 pour Claude Mythos Preview, modèle réservé à des utilisateurs vérifiés ; la génération précédente (Claude Opus 4.6, GLM-5.2) obtenait 0 %. Anthropic rapporte 64 à 100 % de coopération avec des requêtes malveillantes selon les méthodes de contournement, et un retrait des refus des poids pour environ 2 200 heures GPU, soit environ 4 400 dollars.
Ce qui reste à vérifier
Les articles ne donnent pas la date exacte de publication du rapport, ni la réponse éventuelle de Zai, ni la méthodologie complète d'ExploitBench. On ne sait pas non plus si les vulnérabilités concernées ont été signalées aux éditeurs. Les chiffres proviennent d'un acteur en concurrence directe avec le modèle évalué et restent non vérifiés de façon indépendante.