Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

SécuritéFiche benchmark · Université Stanford · cybench.github.io

Cybench

40 épreuves de piratage tirées de compétitions professionnelles : cryptographie, failles web, rétro-ingénierie, analyse de traces.

ARCHIVÉ

À quoi il sert

Cybench alimente le dossier Sécurité, suivi pour information : ce dossier n'a pas de score et n'entre pas dans le score général. Il est archivé, faute de modèle récent mesuré.

Comment c'est noté

Part d'épreuves résolues sans aucune indication intermédiaire (mode « unguided »).

Ce qu'il ne dit pas

Une partie des chiffres vient des fiches des éditeurs, avec leurs propres harnais. Le meilleur modèle dépasse 90 % et les épreuves sont publiques.

Comment lire le score

21 modèles mesurés · 22 mesures

En tête : Claude Opus 4.6, 93 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 75. Le meilleur, Claude Opus 4.6, atteint 93 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
2 %
Score IA 76niveau de Claude Sonnet 4.5
57 %
Score IA 100niveau de Claude Opus 5.5
98 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. Sécurité est un dossier sans score : ses benchmarks sont suivis pour information.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Opus 4.6AnthropicNon précisée93 %91,3
2Claude Opus 4.5AnthropicNon précisée82 %84,4
3Claude Sonnet 4.5Anthropic · 2 configurationsNon précisée60 %77,3
4Grok 4xAINon précisée43 %72,9
5Claude Opus 4.1AnthropicNon précisée42 %72,7
6Grok 4.1xAINon précisée39 %71,9
7Claude Opus 4AnthropicNon précisée38 %71,6
8Claude Sonnet 4AnthropicNon précisée35 %70,8
9Grok 4 FastxAINon précisée30 %69,3
10o3-miniOpenAIMoyenne22,5 %66,8
21 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 21 →Replier le classement ↑
11Claude 3.7 SonnetAnthropicNon précisée20 %65,9
12GPT-4.5OpenAINon précisée17,5 %64,8
12Claude 3.5 SonnetAnthropicNon précisée17,5 %64,8
14GPT-4o (Nov 2024)OpenAINon précisée12,5 %62,3
15o1-previewOpenAINon précisée10 %60,7
15o1-miniOpenAIMoyenne10 %60,7
15Claude 3 OpusAnthropicNon précisée10 %60,7
18Gemini 1.5 Pro (Feb 2024)Google DeepMindNon précisée7,5 %58,7
18Llama 3.1-405BMeta AI · poids ouvertsNon précisée7,5 %58,7
18Mixtral 8x22BMistral AI · poids ouvertsNon précisée7,5 %58,7
21Llama 3-70BMeta AI · poids ouvertsNon précisée5 %55,9

En bref

Que mesure Cybench ?
40 épreuves de piratage tirées de compétitions professionnelles : cryptographie, failles web, rétro-ingénierie, analyse de traces. Sur Quelle IA, il est rangé dans le dossier Sécurité.
Comment Cybench est-il noté ?
Part d'épreuves résolues sans aucune indication intermédiaire (mode « unguided »). Un modèle qui obtient 50 % a un score IA d'environ 75.
Qui est en tête sur Cybench ?
Claude Opus 4.6 (Anthropic) est en tête de Cybench avec 93 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 4.5 (82 %) et Claude Sonnet 4.5 (60 %). 21 modèles y sont mesurés.
Quelles sont les limites de Cybench ?
Une partie des chiffres vient des fiches des éditeurs, avec leurs propres harnais. Le meilleur modèle dépasse 90 % et les épreuves sont publiques. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse Cybench dans le score IA ?
Cybench compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Sécurité est un dossier sans score : ses benchmarks sont suivis pour information.
Qui maintient Cybench ?
Université Stanford. Sa page de référence : cybench.github.io.

Les autres benchmarks du dossier Sécurité

Tous les benchmarks →Comment le score IA est calculé →