# EnigmaEval

> Fiche du benchmark EnigmaEval sur Quelle IA, édition du 28 septembre 2026. 1 184 énigmes de chasses aux énigmes, du niveau débutant au MIT Mystery Hunt, mêlant texte et images et exigeant de longues déductions. En tête au 28 septembre 2026 : Claude Fable 5 (39,3 %). Notation, limites et classement des 41 modèles mesurés.

Page : https://quelleia.com/benchmarks/enigmaeval/
Source du benchmark : https://labs.scale.com/leaderboard/enigma_eval
Mainteneur : Scale AI, avec le Center for AI Safety et le MIT
Tâche : Raisonnement
État : actif

## À quoi il sert

Sur Quelle IA, EnigmaEval sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks.

## Comment c'est noté

Part d'énigmes dont la réponse finale est exactement la bonne.

## Ce qu'il ne dit pas

Les énigmes viennent de concours publics, d'où un risque de fuite que le classement signale lui-même. Scores bas, 39 % au mieux.

## Qui le tient

Scale AI, avec le Center for AI Safety et le MIT.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 47 %. Le meilleur, Claude Fable 5, atteint 39,3 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : moins de 1 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 8 %
- Score IA 100 (niveau de Claude Opus 5.5) : 47 %

## Son poids dans le score IA

1,67 % du score général. EnigmaEval porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.

## Classement (41 modèles mesurés · 46 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Élevée | 39,3 % | 96,7 | https://labs.scale.com/leaderboard/enigma_eval |
| 2 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Élevée | 37,1 % | 95,7 | https://labs.scale.com/leaderboard/enigma_eval |
| 3 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 36,8 % | 95,6 | https://labs.scale.com/leaderboard/enigma_eval |
| 4 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | Élevée | 25,4 % | 90,1 | https://labs.scale.com/leaderboard/enigma_eval |
| 5 | [GPT-5.4 Pro](https://quelleia.com/modeles/gpt-5-4-pro.md) | OpenAI | non précisée | 23,8 % | 89,3 | https://labs.scale.com/leaderboard/enigma_eval |
| 6 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 23,5 % | 89,1 | https://labs.scale.com/leaderboard/enigma_eval |
| 7 | [GPT-5 Pro](https://quelleia.com/modeles/gpt-5-pro.md) | OpenAI | non précisée | 18,8 % | 86,2 | https://labs.scale.com/leaderboard/enigma_eval |
| 8 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 18,2 % | 85,8 | https://labs.scale.com/leaderboard/enigma_eval |
| 9 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 16 % | 84,2 | https://labs.scale.com/leaderboard/enigma_eval |
| 10 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Moyenne | 13,1 % | 81,8 | https://labs.scale.com/leaderboard/enigma_eval |
| 11 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | non précisée | 11,9 % | 80,7 | https://labs.scale.com/leaderboard/enigma_eval |
| 12 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | non précisée | 11,2 % | 80,1 | https://labs.scale.com/leaderboard/enigma_eval |
| 13 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | non précisée | 10,5 % | 79,3 | https://labs.scale.com/leaderboard/enigma_eval |
| 14 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | non précisée | 10,4 % | 79,2 | https://labs.scale.com/leaderboard/enigma_eval |
| 15 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Élevée | 9,2 % | 77,8 | https://labs.scale.com/leaderboard/enigma_eval |
| 16 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | non précisée | 8,2 % | 76,5 | https://labs.scale.com/leaderboard/enigma_eval |
| 17 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Maximale | 7,6 % | 75,7 | https://labs.scale.com/leaderboard/enigma_eval |
| 18 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | non précisée | 7,2 % | 75,1 | https://labs.scale.com/leaderboard/enigma_eval |
| 19 | [o1-pro](https://quelleia.com/modeles/o1-pro.md) | OpenAI | non précisée | 6,1 % | 73,4 | https://labs.scale.com/leaderboard/enigma_eval |
| 20 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | non précisée | 6 % | 73,1 | https://labs.scale.com/leaderboard/enigma_eval |
| 21 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | non précisée | 5,7 % | 72,5 | https://labs.scale.com/leaderboard/enigma_eval |
| 22 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 5,6 % | 72,3 | https://labs.scale.com/leaderboard/enigma_eval |
| 22 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | non précisée | 5,6 % | 72,3 | https://labs.scale.com/leaderboard/enigma_eval |
| 24 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | non précisée | 4,2 % | 69,4 | https://labs.scale.com/leaderboard/enigma_eval |
| 25 | [Gemini 2.5 Pro (Mar 2025)](https://quelleia.com/modeles/gemini-2-5-pro-mar-2025.md) | Google DeepMind | non précisée | 4,1 % | 69,1 | https://labs.scale.com/leaderboard/enigma_eval |
| 26 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 3,4 % | 67,0 | https://labs.scale.com/leaderboard/enigma_eval |
| 27 | [GPT-4.5](https://quelleia.com/modeles/gpt-4-5.md) | OpenAI | non précisée | 3,2 % | 66,4 | https://labs.scale.com/leaderboard/enigma_eval |
| 28 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | non précisée | 3,1 % | 66,2 | https://labs.scale.com/leaderboard/enigma_eval |
| 29 | [Gemini 3.1 Flash-Lite](https://quelleia.com/modeles/gemini-3-1-flash-lite.md) | Google DeepMind | non précisée | 3 % | 65,9 | https://labs.scale.com/leaderboard/enigma_eval |
| 30 | [Gemini 2.5 Flash (May 2025)](https://quelleia.com/modeles/gemini-2-5-flash-may-2025.md) | Google DeepMind | non précisée | 2,7 % | 64,6 | https://labs.scale.com/leaderboard/enigma_eval |
| 31 | [Gemini 2.5 Pro (May 2025)](https://quelleia.com/modeles/gemini-2-5-pro-may-2025.md) | Google DeepMind | non précisée | 2,4 % | 63,2 | https://labs.scale.com/leaderboard/enigma_eval |
| 32 | [GPT-4.1](https://quelleia.com/modeles/gpt-4-1.md) | OpenAI | non précisée | 2,2 % | 62,4 | https://labs.scale.com/leaderboard/enigma_eval |
| 33 | [Gemini 2.0 Flash Thinking (Jan 2025)](https://quelleia.com/modeles/gemini-2-0-flash-thinking-jan-2025.md) | Google DeepMind | non précisée | 1,1 % | 55,3 | https://labs.scale.com/leaderboard/enigma_eval |
| 34 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 0,9 % | 54,4 | https://labs.scale.com/leaderboard/enigma_eval |
| 35 | [Pixtral Large](https://quelleia.com/modeles/pixtral-large.md) | Mistral AI | non précisée | 0,8 % | 54,4 | https://labs.scale.com/leaderboard/enigma_eval |
| 36 | [Claude 3 Opus](https://quelleia.com/modeles/claude-3-opus.md) | Anthropic | non précisée | 0,8 % | 54,4 | https://labs.scale.com/leaderboard/enigma_eval |
| 37 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 0,8 % | 54,4 | https://labs.scale.com/leaderboard/enigma_eval |
| 38 | [Gemini 2.0 Pro](https://quelleia.com/modeles/gemini-2-0-pro.md) | Google DeepMind | non précisée | 0,7 % | 54,4 | https://labs.scale.com/leaderboard/enigma_eval |
| 39 | [Gemini 2.0 Flash (Feb 2025)](https://quelleia.com/modeles/gemini-2-0-flash-feb-2025.md) | Google DeepMind | non précisée | 0,6 % | 54,4 | https://labs.scale.com/leaderboard/enigma_eval |
| 40 | [Llama 4 Maverick](https://quelleia.com/modeles/llama-4-maverick.md) | Meta AI | non précisée | 0,6 % | 54,4 | https://labs.scale.com/leaderboard/enigma_eval |
| 41 | [Llama 3.2 90B](https://quelleia.com/modeles/llama-3-2-90b.md) | Meta AI | non précisée | 0,4 % | 54,4 | https://labs.scale.com/leaderboard/enigma_eval |

## En bref

**Que mesure EnigmaEval ?** 1 184 énigmes de chasses aux énigmes, du niveau débutant au MIT Mystery Hunt, mêlant texte et images et exigeant de longues déductions. Sur Quelle IA, il est rangé dans la tâche Raisonnement.

**Comment EnigmaEval est-il noté ?** Part d'énigmes dont la réponse finale est exactement la bonne. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 47 %.

**Qui est en tête sur EnigmaEval ?** Claude Fable 5 (Anthropic) est en tête d'EnigmaEval avec 39,3 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.6 Sol (37,1 %) et Gemini 3.1 Pro (36,8 %). 41 modèles y sont mesurés.

**Quelles sont les limites d'EnigmaEval ?** Les énigmes viennent de concours publics, d'où un risque de fuite que le classement signale lui-même. Scores bas, 39 % au mieux. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse EnigmaEval dans le score IA ?** EnigmaEval compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.

**Qui maintient EnigmaEval ?** Scale AI, avec le Center for AI Safety et le MIT. Sa page de référence : labs.scale.com/leaderboard/enigma_eval.

## Les autres benchmarks de la tâche Raisonnement

- [DTBench](https://quelleia.com/benchmarks/dtbench.md) : 168 modèles · 1,67 % du score, saturé
- [Chess Puzzles](https://quelleia.com/benchmarks/chess_puzzles.md) : 136 modèles · 1,67 % du score
- [LMCA](https://quelleia.com/benchmarks/lmca.md) : 130 modèles · 1,67 % du score
- [ARC-AGI-1](https://quelleia.com/benchmarks/arc_agi.md) : 82 modèles · 1,67 % du score, saturé
- [SimpleBench](https://quelleia.com/benchmarks/simplebench.md) : 82 modèles · 1,67 % du score
- [ARC-AGI-2](https://quelleia.com/benchmarks/arc_agi_2.md) : 80 modèles · 1,67 % du score, saturé
- [ForecastBench](https://quelleia.com/benchmarks/forecastbench.md) : 77 modèles · 1,67 % du score
- [Mystery Game Puzzles](https://quelleia.com/benchmarks/mystery_game_puzzles.md) : 69 modèles · 1,67 % du score
- [LiveBench, raisonnement](https://quelleia.com/benchmarks/livebench_raisonnement.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
