# ExploitBench

> Fiche du benchmark ExploitBench sur Quelle IA, édition du 28 septembre 2026. Exploiter de vraies failles déjà corrigées du moteur JavaScript de Chrome, de l'accès au code vulnérable jusqu'à l'exécution de code arbitraire. En tête au 28 septembre 2026 : Claude Mythos Preview (73,8 %). Notation, limites et classement des 9 modèles mesurés.

Page : https://quelleia.com/benchmarks/exploitbench/
Source du benchmark : https://exploitbench.ai/
Mainteneur : Université Carnegie Mellon
Tâche : Sécurité
État : actif

## À quoi il sert

ExploitBench alimente le dossier Sécurité, suivi pour information : ce dossier n'a pas de score et n'entre pas dans le score général.

## Comment c'est noté

Part moyenne des 16 jalons atteints sur 41 failles, avec plusieurs essais par faille.

## Ce qu'il ne dit pas

Un seul logiciel cible, le moteur V8. Peu de modèles testés, certains en préversion, et les failles sont déjà documentées publiquement.

## Qui le tient

Université Carnegie Mellon.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 95. Le meilleur, Claude Mythos Preview, atteint 73,8 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %. Avec 9 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : moins de 1 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 12 %
- Score IA 100 (niveau de Claude Opus 5.5) : 62 %

## Son poids dans le score IA

0 % du score général. Sécurité est un dossier sans score : ses benchmarks sont suivis pour information.

## Classement (9 modèles mesurés · 20 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Mythos Preview](https://quelleia.com/modeles/claude-mythos-preview.md) | Anthropic | non précisée | 73,8 % | 105,3 | https://epoch.ai/benchmarks |
| 2 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | non précisée | 47,4 % | 94,3 | https://epoch.ai/benchmarks |
| 3 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | non précisée | 26,5 % | 85,5 | https://epoch.ai/benchmarks |
| 4 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 26,1 % | 85,3 | https://epoch.ai/benchmarks |
| 5 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | non précisée | 23,6 % | 84,0 | https://epoch.ai/benchmarks |
| 6 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 18,4 % | 81,0 | https://epoch.ai/benchmarks |
| 7 | [GLM-5.1](https://quelleia.com/modeles/glm-5-1.md) | Z.ai (Zhipu AI) | non précisée | 18,1 % | 80,8 | https://epoch.ai/benchmarks |
| 8 | [Claude Haiku 4.5](https://quelleia.com/modeles/claude-haiku-4-5.md) | Anthropic | non précisée | 13,7 % | 77,6 | https://epoch.ai/benchmarks |
| 9 | [MiniMax-M2.7](https://quelleia.com/modeles/minimax-m2-7.md) | MiniMax | non précisée | 13,3 % | 77,3 | https://epoch.ai/benchmarks |

## En bref

**Que mesure ExploitBench ?** Exploiter de vraies failles déjà corrigées du moteur JavaScript de Chrome, de l'accès au code vulnérable jusqu'à l'exécution de code arbitraire. Sur Quelle IA, il est rangé dans le dossier Sécurité.

**Comment ExploitBench est-il noté ?** Part moyenne des 16 jalons atteints sur 41 failles, avec plusieurs essais par faille. Un modèle qui obtient 50 % a un score IA d'environ 95.

**Qui est en tête sur ExploitBench ?** Claude Mythos Preview (Anthropic) est en tête d'ExploitBench avec 73,8 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.5 (47,4 %) et Claude Opus 4.7 (26,5 %). 9 modèles y sont mesurés.

**Quelles sont les limites d'ExploitBench ?** Un seul logiciel cible, le moteur V8. Peu de modèles testés, certains en préversion, et les failles sont déjà documentées publiquement. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse ExploitBench dans le score IA ?** ExploitBench compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Sécurité est un dossier sans score : ses benchmarks sont suivis pour information.

**Qui maintient ExploitBench ?** Université Carnegie Mellon. Sa page de référence : exploitbench.ai.

## Les autres benchmarks du dossier Sécurité

- [Cybench](https://quelleia.com/benchmarks/cybench.md) : 21 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
