Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

RaisonnementFiche benchmark · Scale AI, avec le Center for AI Safety et le MIT · labs.scale.com

EnigmaEval

1 184 énigmes de chasses aux énigmes, du niveau débutant au MIT Mystery Hunt, mêlant texte et images et exigeant de longues déductions.

À quoi il sert

Sur Quelle IA, EnigmaEval sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks.

Comment c'est noté

Part d'énigmes dont la réponse finale est exactement la bonne.

Ce qu'il ne dit pas

Les énigmes viennent de concours publics, d'où un risque de fuite que le classement signale lui-même. Scores bas, 39 % au mieux.

Comment lire le score

41 modèles mesurés · 46 mesures

En tête : Claude Fable 5, 39,3 %

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 47 %. Le meilleur, Claude Fable 5, atteint 39,3 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
8 %
Score IA 100niveau de Claude Opus 5.5
47 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. EnigmaEval porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.

En couleur, la tâche Raisonnement dans le score général. En noir, la part d'EnigmaEval.

Le classement du benchmark

Scores relevés sur labs.scale.com · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Fable 5AnthropicÉlevée39,3 %96,7
2GPT-5.6 SolOpenAIÉlevée37,1 %95,7
3Gemini 3.1 ProGoogle DeepMindNon précisée36,8 %95,6
4Gemini 3.5 FlashGoogle DeepMindÉlevée25,4 %90,1
5GPT-5.4 ProOpenAINon précisée23,8 %89,3
6Claude Opus 4.8AnthropicMaximale23,5 %89,1
7GPT-5 ProOpenAINon précisée18,8 %86,2
8Gemini 3 ProGoogle DeepMindNon précisée18,2 %85,8
9GPT-5.4OpenAIMaximale16 %84,2
10o3OpenAI · 2 configurationsMoyenne13,1 %81,8
41 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 41 →Replier le classement ↑
11Claude Opus 4.5AnthropicNon précisée11,9 %80,7
12GPT-5.1OpenAI · 2 configurationsNon précisée11,2 %80,1
13GPT-5OpenAINon précisée10,5 %79,3
14GPT-5.2OpenAINon précisée10,4 %79,2
15o4-miniOpenAI · 2 configurationsÉlevée9,2 %77,8
16GPT-5 miniOpenAINon précisée8,2 %76,5
17Claude Opus 4.6Anthropic · 2 configurationsMaximale7,6 %75,7
18Claude Opus 4.1AnthropicNon précisée7,2 %75,1
19o1-proOpenAINon précisée6,1 %73,4
20Claude Sonnet 4.5AnthropicNon précisée6 %73,1
21o1OpenAINon précisée5,7 %72,5
22Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée5,6 %72,3
22Claude Opus 4AnthropicNon précisée5,6 %72,3
24Claude 3.7 SonnetAnthropic · 2 configurationsNon précisée4,2 %69,4
25Gemini 2.5 Pro (Mar 2025)Google DeepMindNon précisée4,1 %69,1
26Kimi K2.5Moonshot · poids ouvertsNon précisée3,4 %67,0
27GPT-4.5OpenAINon précisée3,2 %66,4
28Claude Sonnet 4AnthropicNon précisée3,1 %66,2
29Gemini 3.1 Flash-LiteGoogle DeepMindNon précisée3 %65,9
30Gemini 2.5 Flash (May 2025)Google DeepMindNon précisée2,7 %64,6
31Gemini 2.5 Pro (May 2025)Google DeepMindNon précisée2,4 %63,2
32GPT-4.1OpenAINon précisée2,2 %62,4
33Gemini 2.0 Flash Thinking (Jan 2025)Google DeepMindNon précisée1,1 %55,3
34Claude 3.5 Sonnet (October 2024)AnthropicNon précisée0,9 %54,4
35Pixtral LargeMistral AI · poids ouvertsNon précisée0,8 %54,4
36Claude 3 OpusAnthropicNon précisée0,8 %54,4
37GPT-4o (Nov 2024)OpenAINon précisée0,8 %54,4
38Gemini 2.0 ProGoogle DeepMindNon précisée0,7 %54,4
39Gemini 2.0 Flash (Feb 2025)Google DeepMindNon précisée0,6 %54,4
40Llama 4 MaverickMeta AI · poids ouvertsNon précisée0,6 %54,4
41Llama 3.2 90BMeta AI · poids ouvertsNon précisée0,4 %54,4

En bref

Que mesure EnigmaEval ?
1 184 énigmes de chasses aux énigmes, du niveau débutant au MIT Mystery Hunt, mêlant texte et images et exigeant de longues déductions. Sur Quelle IA, il est rangé dans la tâche Raisonnement.
Comment EnigmaEval est-il noté ?
Part d'énigmes dont la réponse finale est exactement la bonne. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 47 %.
Qui est en tête sur EnigmaEval ?
Claude Fable 5 (Anthropic) est en tête d'EnigmaEval avec 39,3 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.6 Sol (37,1 %) et Gemini 3.1 Pro (36,8 %). 41 modèles y sont mesurés.
Quelles sont les limites d'EnigmaEval ?
Les énigmes viennent de concours publics, d'où un risque de fuite que le classement signale lui-même. Scores bas, 39 % au mieux. Au 28 septembre 2026, le benchmark est actif.
Combien pèse EnigmaEval dans le score IA ?
EnigmaEval compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.
Qui maintient EnigmaEval ?
Scale AI, avec le Center for AI Safety et le MIT. Sa page de référence : labs.scale.com/leaderboard/enigma_eval.

Les autres benchmarks de la tâche Raisonnement

Tous les benchmarks →Comment le score IA est calculé →