Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

SécuritéFiche benchmark · Université Carnegie Mellon · exploitbench.ai

ExploitBench

Exploiter de vraies failles déjà corrigées du moteur JavaScript de Chrome, de l'accès au code vulnérable jusqu'à l'exécution de code arbitraire.

À quoi il sert

ExploitBench alimente le dossier Sécurité, suivi pour information : ce dossier n'a pas de score et n'entre pas dans le score général.

Comment c'est noté

Part moyenne des 16 jalons atteints sur 41 failles, avec plusieurs essais par faille.

Ce qu'il ne dit pas

Un seul logiciel cible, le moteur V8. Peu de modèles testés, certains en préversion, et les failles sont déjà documentées publiquement.

Comment lire le score

9 modèles mesurés · 20 mesures

En tête : Claude Mythos Preview, 73,8 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 95. Le meilleur, Claude Mythos Preview, atteint 73,8 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %. Avec 9 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
12 %
Score IA 100niveau de Claude Opus 5.5
62 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. Sécurité est un dossier sans score : ses benchmarks sont suivis pour information.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Mythos PreviewAnthropic · 2 configurationsNon précisée73,8 %105,3
2GPT-5.5OpenAI · 4 configurationsNon précisée47,4 %94,3
3Claude Opus 4.7Anthropic · 2 configurationsNon précisée26,5 %85,5
4Gemini 3.1 ProGoogle DeepMind · 2 configurationsNon précisée26,1 %85,3
5Claude Sonnet 4.6Anthropic · 2 configurationsNon précisée23,6 %84,0
6Kimi K2.6Moonshot · poids ouverts · 2 configurationsNon précisée18,4 %81,0
7GLM-5.1Z.ai (Zhipu AI) · poids ouverts · 2 configurationsNon précisée18,1 %80,8
8Claude Haiku 4.5Anthropic · 2 configurationsNon précisée13,7 %77,6
9MiniMax-M2.7MiniMax · poids ouverts · 2 configurationsNon précisée13,3 %77,3

9 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

En bref

Que mesure ExploitBench ?
Exploiter de vraies failles déjà corrigées du moteur JavaScript de Chrome, de l'accès au code vulnérable jusqu'à l'exécution de code arbitraire. Sur Quelle IA, il est rangé dans le dossier Sécurité.
Comment ExploitBench est-il noté ?
Part moyenne des 16 jalons atteints sur 41 failles, avec plusieurs essais par faille. Un modèle qui obtient 50 % a un score IA d'environ 95.
Qui est en tête sur ExploitBench ?
Claude Mythos Preview (Anthropic) est en tête d'ExploitBench avec 73,8 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.5 (47,4 %) et Claude Opus 4.7 (26,5 %). 9 modèles y sont mesurés.
Quelles sont les limites d'ExploitBench ?
Un seul logiciel cible, le moteur V8. Peu de modèles testés, certains en préversion, et les failles sont déjà documentées publiquement. Au 28 septembre 2026, le benchmark est actif.
Combien pèse ExploitBench dans le score IA ?
ExploitBench compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Sécurité est un dossier sans score : ses benchmarks sont suivis pour information.
Qui maintient ExploitBench ?
Université Carnegie Mellon. Sa page de référence : exploitbench.ai.

Les autres benchmarks du dossier Sécurité

Tous les benchmarks →Comment le score IA est calculé →