# Cybench

> Fiche du benchmark Cybench sur Quelle IA, édition du 28 septembre 2026. 40 épreuves de piratage tirées de compétitions professionnelles : cryptographie, failles web, rétro-ingénierie, analyse de traces. En tête au 28 septembre 2026 : Claude Opus 4.6 (93 %). Notation, limites et classement des 21 modèles mesurés.

Page : https://quelleia.com/benchmarks/cybench/
Source du benchmark : https://cybench.github.io/
Mainteneur : Université Stanford
Tâche : Sécurité
État : archivé

## À quoi il sert

Cybench alimente le dossier Sécurité, suivi pour information : ce dossier n'a pas de score et n'entre pas dans le score général. Il est archivé, faute de modèle récent mesuré.

## Comment c'est noté

Part d'épreuves résolues sans aucune indication intermédiaire (mode « unguided »).

## Ce qu'il ne dit pas

Une partie des chiffres vient des fiches des éditeurs, avec leurs propres harnais. Le meilleur modèle dépasse 90 % et les épreuves sont publiques.

## Qui le tient

Université Stanford.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 75. Le meilleur, Claude Opus 4.6, atteint 93 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 2 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 57 %
- Score IA 100 (niveau de Claude Opus 5.5) : 98 %

## Son poids dans le score IA

0 % du score général. Sécurité est un dossier sans score : ses benchmarks sont suivis pour information.

## Classement (21 modèles mesurés · 22 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | non précisée | 93 % | 91,3 | https://epoch.ai/benchmarks |
| 2 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | non précisée | 82 % | 84,4 | https://epoch.ai/benchmarks |
| 3 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | non précisée | 60 % | 77,3 | https://epoch.ai/benchmarks |
| 4 | [Grok 4](https://quelleia.com/modeles/grok-4.md) | xAI | non précisée | 43 % | 72,9 | https://epoch.ai/benchmarks |
| 5 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | non précisée | 42 % | 72,7 | https://epoch.ai/benchmarks |
| 6 | [Grok 4.1](https://quelleia.com/modeles/grok-4-1.md) | xAI | non précisée | 39 % | 71,9 | https://epoch.ai/benchmarks |
| 7 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | non précisée | 38 % | 71,6 | https://epoch.ai/benchmarks |
| 8 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | non précisée | 35 % | 70,8 | https://epoch.ai/benchmarks |
| 9 | [Grok 4 Fast](https://quelleia.com/modeles/grok-4-fast.md) | xAI | non précisée | 30 % | 69,3 | https://epoch.ai/benchmarks |
| 10 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Moyenne | 22,5 % | 66,8 | https://epoch.ai/benchmarks |
| 11 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | non précisée | 20 % | 65,9 | https://epoch.ai/benchmarks |
| 12 | [GPT-4.5](https://quelleia.com/modeles/gpt-4-5.md) | OpenAI | non précisée | 17,5 % | 64,8 | https://epoch.ai/benchmarks |
| 12 | [Claude 3.5 Sonnet](https://quelleia.com/modeles/claude-3-5-sonnet.md) | Anthropic | non précisée | 17,5 % | 64,8 | https://epoch.ai/benchmarks |
| 14 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 12,5 % | 62,3 | https://epoch.ai/benchmarks |
| 15 | [o1-preview](https://quelleia.com/modeles/o1-preview.md) | OpenAI | non précisée | 10 % | 60,7 | https://epoch.ai/benchmarks |
| 15 | [o1-mini](https://quelleia.com/modeles/o1-mini.md) | OpenAI | Moyenne | 10 % | 60,7 | https://epoch.ai/benchmarks |
| 15 | [Claude 3 Opus](https://quelleia.com/modeles/claude-3-opus.md) | Anthropic | non précisée | 10 % | 60,7 | https://epoch.ai/benchmarks |
| 18 | [Gemini 1.5 Pro (Feb 2024)](https://quelleia.com/modeles/gemini-1-5-pro-feb-2024.md) | Google DeepMind | non précisée | 7,5 % | 58,7 | https://epoch.ai/benchmarks |
| 18 | [Llama 3.1-405B](https://quelleia.com/modeles/llama-3-1-405b.md) | Meta AI | non précisée | 7,5 % | 58,7 | https://epoch.ai/benchmarks |
| 18 | [Mixtral 8x22B](https://quelleia.com/modeles/mixtral-8x22b.md) | Mistral AI | non précisée | 7,5 % | 58,7 | https://epoch.ai/benchmarks |
| 21 | [Llama 3-70B](https://quelleia.com/modeles/llama-3-70b.md) | Meta AI | non précisée | 5 % | 55,9 | https://epoch.ai/benchmarks |

## En bref

**Que mesure Cybench ?** 40 épreuves de piratage tirées de compétitions professionnelles : cryptographie, failles web, rétro-ingénierie, analyse de traces. Sur Quelle IA, il est rangé dans le dossier Sécurité.

**Comment Cybench est-il noté ?** Part d'épreuves résolues sans aucune indication intermédiaire (mode « unguided »). Un modèle qui obtient 50 % a un score IA d'environ 75.

**Qui est en tête sur Cybench ?** Claude Opus 4.6 (Anthropic) est en tête de Cybench avec 93 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 4.5 (82 %) et Claude Sonnet 4.5 (60 %). 21 modèles y sont mesurés.

**Quelles sont les limites de Cybench ?** Une partie des chiffres vient des fiches des éditeurs, avec leurs propres harnais. Le meilleur modèle dépasse 90 % et les épreuves sont publiques. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse Cybench dans le score IA ?** Cybench compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Sécurité est un dossier sans score : ses benchmarks sont suivis pour information.

**Qui maintient Cybench ?** Université Stanford. Sa page de référence : cybench.github.io.

## Les autres benchmarks du dossier Sécurité

- [ExploitBench](https://quelleia.com/benchmarks/exploitbench.md) : 9 modèles · hors score

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
