Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Classement · édition du

Classement des modèles de langage, Sécurité

Que valent les modèles en sécurité informatique ?

Un dossier, sans scorePourquoi pas de score ?

Sécurité ne pèse pas dans le score général et n'a pas de classement. Les benchmarks de ce dossier sont suivis et leurs résultats figurent sur la fiche de chaque modèle, mais ils sont trop peu nombreux pour donner un score fiable.

Dans l'édition du 28 septembre 2026, Quelle IA suit 2 benchmarks sur la sécurité informatique, dont 1 encore actif. C'est trop peu, et les sources sont trop inégales, pour en tirer un score et un classement honnêtes : Sécurité reste un dossier, qui ne pèse pas dans le score général. Voir le classement général.

ExploitBenchACTIF

Exploiter de vraies failles déjà corrigées du moteur JavaScript de Chrome, de l'accès au code vulnérable jusqu'à l'exécution de code arbitraire.

Notation
Part moyenne des 16 jalons atteints sur 41 failles, avec plusieurs essais par faille.
Limites
Un seul logiciel cible, le moteur V8. Peu de modèles testés, certains en préversion, et les failles sont déjà documentées publiquement.
Tenu par
Université Carnegie Mellon
  1. Claude Mythos Preview73,8 %
  2. GPT-5.547,4 %
  3. Claude Opus 4.726,5 %

9 modèles mesurésLa fiche du benchmark →exploitbench.ai ↗

CybenchARCHIVÉ

40 épreuves de piratage tirées de compétitions professionnelles : cryptographie, failles web, rétro-ingénierie, analyse de traces.

Notation
Part d'épreuves résolues sans aucune indication intermédiaire (mode « unguided »).
Limites
Une partie des chiffres vient des fiches des éditeurs, avec leurs propres harnais. Le meilleur modèle dépasse 90 % et les épreuves sont publiques.
Tenu par
Université Stanford
  1. Claude Opus 4.693 %
  2. Claude Opus 4.582 %
  3. Claude Sonnet 4.560 %

21 modèles mesurésLa fiche du benchmark →cybench.github.io ↗