# Mystery Game Puzzles

> Fiche du benchmark Mystery Game Puzzles sur Quelle IA, édition du 28 septembre 2026. 100 positions d'un jeu dont Epoch tait le nom, décrites en texte, où le modèle doit trouver le meilleur coup. En tête au 28 septembre 2026 : GPT-6 Astra (84 %). Notation, limites et classement des 69 modèles mesurés.

Page : https://quelleia.com/benchmarks/mystery_game_puzzles/
Source du benchmark : https://epoch.ai/benchmarks/mystery-game-puzzles
Mainteneur : Epoch AI
Tâche : Raisonnement
État : actif

## À quoi il sert

Sur Quelle IA, Mystery Game Puzzles sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 95.

## Comment c'est noté

Part de positions où le coup soumis correspond à la solution ; un coup invalide compte comme faux.

Pour le calcul, ce score est ramené entre 0 et 1 : 9 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Ni le nom du jeu, ni les consignes, ni les transcriptions ne sont publiés. Cela limite les fuites mais empêche toute vérification extérieure.

## Qui le tient

Epoch AI.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 55 % a un score IA d'environ 95. Le meilleur, GPT-6 Astra, atteint 84 %. Le benchmark sera dit saturé quand un modèle atteindra 95,5 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 9 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 14 %
- Score IA 100 (niveau de Claude Opus 5.5) : 72 %

## Son poids dans le score IA

1,67 % du score général. Mystery Game Puzzles porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.

## Classement (69 modèles mesurés · 131 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | Maximale | 84 % | 104,7 | https://epoch.ai/benchmarks |
| 2 | [Claude Opus 5.5](https://quelleia.com/modeles/claude-opus-5-5.md) | Anthropic | Maximale | 71 % | 99,7 | https://epoch.ai/benchmarks |
| 3 | [Claude Sonnet 5.5](https://quelleia.com/modeles/claude-sonnet-5-5.md) | Anthropic | Maximale | 65 % | 97,8 | https://epoch.ai/benchmarks |
| 4 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 59 % | 96,1 | https://epoch.ai/benchmarks |
| 5 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | Maximale | 58 % | 95,8 | https://epoch.ai/benchmarks |
| 5 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 58 % | 95,8 | https://epoch.ai/benchmarks |
| 7 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 56 % | 95,3 | https://epoch.ai/benchmarks |
| 8 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Maximale | 52 % | 94,1 | https://epoch.ai/benchmarks |
| 9 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | Élevée | 47 % | 92,7 | https://epoch.ai/benchmarks |
| 10 | [DeepSeek V4 Pro 0813](https://quelleia.com/modeles/deepseek-v4-pro-0813.md) | DeepSeek | Maximale | 43 % | 91,6 | https://epoch.ai/benchmarks |
| 11 | [Qwen 3.8 Max](https://quelleia.com/modeles/qwen-3-8-max.md) | Alibaba | Maximale | 38 % | 90,0 | https://epoch.ai/benchmarks |
| 12 | [Gemini 3.7 Flash](https://quelleia.com/modeles/gemini-3-7-flash.md) | Google DeepMind | Élevée | 37 % | 89,7 | https://epoch.ai/benchmarks |
| 12 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 37 % | 89,7 | https://epoch.ai/benchmarks |
| 14 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 36 % | 89,4 | https://epoch.ai/benchmarks |
| 15 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 35 % | 89,0 | https://epoch.ai/benchmarks |
| 15 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | Maximale | 35 % | 89,0 | https://epoch.ai/benchmarks |
| 17 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | Maximale | 34 % | 88,7 | https://epoch.ai/benchmarks |
| 17 | [DeepSeek V4 Flash 0731](https://quelleia.com/modeles/deepseek-v4-flash-0731.md) | DeepSeek | Maximale | 34 % | 88,7 | https://epoch.ai/benchmarks |
| 17 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | Élevée | 34 % | 88,7 | https://epoch.ai/benchmarks |
| 20 | [GLM-5.3](https://quelleia.com/modeles/glm-5-3.md) | Z.ai (Zhipu AI) | Maximale | 33 % | 88,3 | https://epoch.ai/benchmarks |
| 21 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | Élevée | 32 % | 87,9 | https://epoch.ai/benchmarks |
| 21 | [Qwen3.7-Max](https://quelleia.com/modeles/qwen3-7-max.md) | Alibaba | non précisée | 32 % | 87,9 | https://epoch.ai/benchmarks |
| 23 | [Gemini 3.6 Flash](https://quelleia.com/modeles/gemini-3-6-flash.md) | Google DeepMind | Élevée | 30 % | 87,2 | https://epoch.ai/benchmarks |
| 24 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Élevée | 29 % | 86,8 | https://epoch.ai/benchmarks |
| 25 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Maximale | 28 % | 86,4 | https://epoch.ai/benchmarks |
| 26 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | Maximale | 26 % | 85,5 | https://epoch.ai/benchmarks |
| 26 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | Faible | 26 % | 85,5 | https://epoch.ai/benchmarks |
| 28 | [Muse Spark 1.3](https://quelleia.com/modeles/muse-spark-1-3.md) | Meta AI | Maximale | 25 % | 85,0 | https://epoch.ai/benchmarks |
| 28 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Maximale | 25 % | 85,0 | https://epoch.ai/benchmarks |
| 30 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Élevée | 23 % | 84,0 | https://epoch.ai/benchmarks |
| 30 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 23 % | 84,0 | https://epoch.ai/benchmarks |
| 32 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | Budget | 22 % | 83,4 | https://epoch.ai/benchmarks |
| 32 | [Qwen 3.6 35B-A3B](https://quelleia.com/modeles/qwen-3-6-35b-a3b.md) | Alibaba | Sans | 22 % | 83,4 | https://epoch.ai/benchmarks |
| 34 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | Maximale | 21 % | 82,8 | https://epoch.ai/benchmarks |
| 34 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | Budget | 21 % | 82,8 | https://epoch.ai/benchmarks |
| 36 | [Nemotron 3 Ultra](https://quelleia.com/modeles/nemotron-3-ultra.md) | NVIDIA | non précisée | 20 % | 82,2 | https://epoch.ai/benchmarks |
| 36 | [Qwen 3.5 Flash (hosted 35B-A3B)](https://quelleia.com/modeles/qwen-3-5-flash-hosted-35b-a3b.md) | Alibaba | non précisée | 20 % | 82,2 | https://epoch.ai/benchmarks |
| 38 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | Faible | 19 % | 81,5 | https://epoch.ai/benchmarks |
| 38 | [Qwen 3.6 Max (Preview)](https://quelleia.com/modeles/qwen-3-6-max-preview.md) | Alibaba | Sans | 19 % | 81,5 | https://epoch.ai/benchmarks |
| 38 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Faible | 19 % | 81,5 | https://epoch.ai/benchmarks |
| 38 | [Gemini 3.5 Flash-Lite](https://quelleia.com/modeles/gemini-3-5-flash-lite.md) | Google DeepMind | Faible | 19 % | 81,5 | https://epoch.ai/benchmarks |
| 42 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 18 % | 80,7 | https://epoch.ai/benchmarks |
| 42 | [Qwen3.5 397B-A17B](https://quelleia.com/modeles/qwen3-5-397b-a17b.md) | Alibaba | Sans | 18 % | 80,7 | https://epoch.ai/benchmarks |
| 42 | [Qwen 3.6 Flash](https://quelleia.com/modeles/qwen-3-6-flash.md) | Alibaba | Sans | 18 % | 80,7 | https://epoch.ai/benchmarks |
| 45 | [DeepSeek-V4-Pro](https://quelleia.com/modeles/deepseek-v4-pro.md) | DeepSeek | Sans | 17 % | 79,9 | https://epoch.ai/benchmarks |
| 45 | [Qwen3.7-Plus](https://quelleia.com/modeles/qwen3-7-plus.md) | Alibaba | Sans | 17 % | 79,9 | https://epoch.ai/benchmarks |
| 45 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | Budget | 17 % | 79,9 | https://epoch.ai/benchmarks |
| 45 | [Qwen 3.5 Plus (hosted 397B-A17B)](https://quelleia.com/modeles/qwen-3-5-plus-hosted-397b-a17b.md) | Alibaba | Sans | 17 % | 79,9 | https://epoch.ai/benchmarks |
| 45 | [Qwen3.5-122B-A10B](https://quelleia.com/modeles/qwen3-5-122b-a10b.md) | Alibaba | Sans | 17 % | 79,9 | https://epoch.ai/benchmarks |
| 50 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | Faible | 16 % | 78,9 | https://epoch.ai/benchmarks |
| 51 | [Qwen3.7 Flash](https://quelleia.com/modeles/qwen3-7-flash.md) | Alibaba | non précisée | 15 % | 77,8 | https://epoch.ai/benchmarks |
| 52 | [Qwen 3.6 Plus](https://quelleia.com/modeles/qwen-3-6-plus.md) | Alibaba | Sans | 12 % | 73,0 | https://epoch.ai/benchmarks |
| 52 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 12 % | 73,0 | https://epoch.ai/benchmarks |
| 52 | [GPT-4 (Jun 2023)](https://quelleia.com/modeles/gpt-4-jun-2023.md) | OpenAI | non précisée | 12 % | 73,0 | https://epoch.ai/benchmarks |
| 55 | [GPT-5.4 Mini](https://quelleia.com/modeles/gpt-5-4-mini.md) | OpenAI | Sans | 11 % | 70,1 | https://epoch.ai/benchmarks |
| 56 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | Faible | 10 % | 65,7 | https://epoch.ai/benchmarks |
| 57 | [GPT-5.4 Nano](https://quelleia.com/modeles/gpt-5-4-nano.md) | OpenAI | Sans | 9 % | 65,7 | https://epoch.ai/benchmarks |
| 57 | [Qwen3-235B-A22B-Thinking (Jul 2025)](https://quelleia.com/modeles/qwen3-235b-a22b-thinking-jul-2025.md) | Alibaba | non précisée | 9 % | 65,7 | https://epoch.ai/benchmarks |
| 57 | [GPT-5 nano](https://quelleia.com/modeles/gpt-5-nano.md) | OpenAI | Faible | 9 % | 65,7 | https://epoch.ai/benchmarks |
| 60 | [GLM-5.3-Flash](https://quelleia.com/modeles/glm-5-3-flash.md) | Z.ai (Zhipu AI) | Maximale | 8 % | 65,7 | https://epoch.ai/benchmarks |
| 60 | [MiniMax-M3](https://quelleia.com/modeles/minimax-m3.md) | MiniMax | Sans | 8 % | 65,7 | https://epoch.ai/benchmarks |
| 62 | [Qwen3.6 27B](https://quelleia.com/modeles/qwen3-6-27b.md) | Alibaba | Sans | 7 % | 65,7 | https://epoch.ai/benchmarks |
| 62 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 7 % | 65,7 | https://epoch.ai/benchmarks |
| 62 | [GPT-4.1 mini](https://quelleia.com/modeles/gpt-4-1-mini.md) | OpenAI | non précisée | 7 % | 65,7 | https://epoch.ai/benchmarks |
| 65 | [Inkling-Small](https://quelleia.com/modeles/inkling-small.md) | Thinking Machines | Maximale | 6 % | 65,7 | https://epoch.ai/benchmarks |
| 66 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Élevée | 5 % | 65,7 | https://epoch.ai/benchmarks |
| 66 | [Qwen3-Max](https://quelleia.com/modeles/qwen3-max.md) | Alibaba | non précisée | 5 % | 65,7 | https://epoch.ai/benchmarks |
| 68 | [GPT-3.5 Turbo (Jan 2024)](https://quelleia.com/modeles/gpt-3-5-turbo-jan-2024.md) | OpenAI | non précisée | 3 % | 65,7 | https://epoch.ai/benchmarks |
| 69 | [gpt-oss-120b](https://quelleia.com/modeles/gpt-oss-120b.md) | OpenAI | Moyenne | 2 % | 65,7 | https://epoch.ai/benchmarks |

## En bref

**Que mesure Mystery Game Puzzles ?** 100 positions d'un jeu dont Epoch tait le nom, décrites en texte, où le modèle doit trouver le meilleur coup. Sur Quelle IA, il est rangé dans la tâche Raisonnement.

**Comment Mystery Game Puzzles est-il noté ?** Part de positions où le coup soumis correspond à la solution ; un coup invalide compte comme faux. Un modèle qui obtient 55 % a un score IA d'environ 95.

**Qui est en tête sur Mystery Game Puzzles ?** GPT-6 Astra (OpenAI) est en tête de Mystery Game Puzzles avec 84 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5.5 (71 %) et Claude Sonnet 5.5 (65 %). 69 modèles y sont mesurés.

**Quelles sont les limites de Mystery Game Puzzles ?** Ni le nom du jeu, ni les consignes, ni les transcriptions ne sont publiés. Cela limite les fuites mais empêche toute vérification extérieure. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse Mystery Game Puzzles dans le score IA ?** Mystery Game Puzzles compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.

**Qui maintient Mystery Game Puzzles ?** Epoch AI. Sa page de référence : epoch.ai/benchmarks/mystery-game-puzzles.

## Les autres benchmarks de la tâche Raisonnement

- [DTBench](https://quelleia.com/benchmarks/dtbench.md) : 168 modèles · 1,67 % du score, saturé
- [Chess Puzzles](https://quelleia.com/benchmarks/chess_puzzles.md) : 136 modèles · 1,67 % du score
- [LMCA](https://quelleia.com/benchmarks/lmca.md) : 130 modèles · 1,67 % du score
- [ARC-AGI-1](https://quelleia.com/benchmarks/arc_agi.md) : 82 modèles · 1,67 % du score, saturé
- [SimpleBench](https://quelleia.com/benchmarks/simplebench.md) : 82 modèles · 1,67 % du score
- [ARC-AGI-2](https://quelleia.com/benchmarks/arc_agi_2.md) : 80 modèles · 1,67 % du score, saturé
- [ForecastBench](https://quelleia.com/benchmarks/forecastbench.md) : 77 modèles · 1,67 % du score
- [EnigmaEval](https://quelleia.com/benchmarks/enigmaeval.md) : 41 modèles · 1,67 % du score
- [LiveBench, raisonnement](https://quelleia.com/benchmarks/livebench_raisonnement.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
