Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

RaisonnementFiche benchmark · Epoch AI · epoch.ai

Mystery Game Puzzles

100 positions d'un jeu dont Epoch tait le nom, décrites en texte, où le modèle doit trouver le meilleur coup.

À quoi il sert

Sur Quelle IA, Mystery Game Puzzles sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 95.

Comment c'est noté

Part de positions où le coup soumis correspond à la solution ; un coup invalide compte comme faux.

Pour le calcul, ce score est ramené entre 0 et 1 : 9 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Ni le nom du jeu, ni les consignes, ni les transcriptions ne sont publiés. Cela limite les fuites mais empêche toute vérification extérieure.

Comment lire le score

69 modèles mesurés · 131 mesures

En tête : GPT-6 Astra, 84 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 55 % a un score IA d'environ 95. Le meilleur, GPT-6 Astra, atteint 84 %. Le benchmark sera dit saturé quand un modèle atteindra 95,5 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
9 %
Score IA 76niveau de Claude Sonnet 4.5
14 %
Score IA 100niveau de Claude Opus 5.5
72 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. Mystery Game Puzzles porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.

En couleur, la tâche Raisonnement dans le score général. En noir, la part de Mystery Game Puzzles.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAIMaximale84 %104,7
2Claude Opus 5.5AnthropicMaximale71 %99,7
3Claude Sonnet 5.5AnthropicMaximale65 %97,8
4Claude Opus 5Anthropic · 2 configurationsMaximale59 %96,1
5Claude Fable 5.1AnthropicMaximale58 %95,8
5GPT-5.6 SolOpenAI · 3 configurationsMaximale58 %95,8
7GPT-5.5OpenAI · 4 configurationsMaximale56 %95,3
8Claude Fable 5AnthropicMaximale52 %94,1
9Gemini 3.8 FlashGoogle DeepMindÉlevée47 %92,7
10DeepSeek V4 Pro 0813DeepSeek · poids ouvertsMaximale43 %91,6
69 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 69 →Replier le classement ↑
11Qwen 3.8 MaxAlibabaMaximale38 %90,0
12Gemini 3.7 FlashGoogle DeepMindÉlevée37 %89,7
12GPT-5.4OpenAI · 4 configurationsMaximale37 %89,7
14Claude Opus 4.8Anthropic · 2 configurationsMaximale36 %89,4
15GPT-5.6 TerraOpenAI · 4 configurationsMaximale35 %89,0
15Claude Sonnet 5Anthropic · 2 configurationsMaximale35 %89,0
17Grok 4.6xAIMaximale34 %88,7
17DeepSeek V4 Flash 0731DeepSeek · poids ouvertsMaximale34 %88,7
17Gemini 3.1 ProGoogle DeepMind · 3 configurationsÉlevée34 %88,7
20GLM-5.3Z.ai (Zhipu AI) · poids ouvertsMaximale33 %88,3
21Gemini 3.5 FlashGoogle DeepMind · 2 configurationsÉlevée32 %87,9
21Qwen3.7-MaxAlibaba · 2 configurationsNon précisée32 %87,9
23Gemini 3.6 FlashGoogle DeepMind · 3 configurationsÉlevée30 %87,2
24o3OpenAI · 2 configurationsÉlevée29 %86,8
25Claude Opus 4.7Anthropic · 2 configurationsMaximale28 %86,4
26Kimi K3Moonshot · poids ouverts · 2 configurationsMaximale26 %85,5
26Gemini 3 FlashGoogle DeepMind · 3 configurationsFaible26 %85,5
28Muse Spark 1.3Meta AI · 2 configurationsMaximale25 %85,0
28Claude Opus 4.6Anthropic · 3 configurationsMaximale25 %85,0
30GPT-5.2OpenAI · 4 configurationsÉlevée23 %84,0
30GPT-5OpenAI · 4 configurationsÉlevée23 %84,0
32Claude Opus 4.5AnthropicBudget22 %83,4
32Qwen 3.6 35B-A3BAlibaba · poids ouvertsSans22 %83,4
34GPT-5.6 LunaOpenAI · 4 configurationsMaximale21 %82,8
34Claude Opus 4.1AnthropicBudget21 %82,8
36Nemotron 3 UltraNVIDIA · poids ouvertsNon précisée20 %82,2
36Qwen 3.5 Flash (hosted 35B-A3B)Alibaba · 2 configurationsNon précisée20 %82,2
38GLM-5.2Z.ai (Zhipu AI) · poids ouverts · 4 configurationsFaible19 %81,5
38Qwen 3.6 Max (Preview)AlibabaSans19 %81,5
38GPT-5.1OpenAI · 3 configurationsFaible19 %81,5
38Gemini 3.5 Flash-LiteGoogle DeepMind · 2 configurationsFaible19 %81,5
42Kimi K2.6Moonshot · poids ouverts · 2 configurationsNon précisée18 %80,7
42Qwen3.5 397B-A17BAlibaba · poids ouvertsSans18 %80,7
42Qwen 3.6 FlashAlibaba · 2 configurationsSans18 %80,7
45DeepSeek-V4-ProDeepSeek · poids ouvertsSans17 %79,9
45Qwen3.7-PlusAlibaba · 2 configurationsSans17 %79,9
45Claude Sonnet 4.5AnthropicBudget17 %79,9
45Qwen 3.5 Plus (hosted 397B-A17B)Alibaba · 2 configurationsSans17 %79,9
45Qwen3.5-122B-A10BAlibaba · poids ouvertsSans17 %79,9
50Claude Sonnet 4.6Anthropic · 2 configurationsFaible16 %78,9
51Qwen3.7 FlashAlibaba · 2 configurationsNon précisée15 %77,8
52Qwen 3.6 PlusAlibabaSans12 %73,0
52GPT-4o miniOpenAINon précisée12 %73,0
52GPT-4 (Jun 2023)OpenAINon précisée12 %73,0
55GPT-5.4 MiniOpenAI · 3 configurationsSans11 %70,1
56GPT-5 miniOpenAI · 3 configurationsFaible10 %65,7
57GPT-5.4 NanoOpenAI · 4 configurationsSans9 %65,7
57Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée9 %65,7
57GPT-5 nanoOpenAI · 4 configurationsFaible9 %65,7
60GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsMaximale8 %65,7
60MiniMax-M3MiniMax · poids ouverts · 2 configurationsSans8 %65,7
62Qwen3.6 27BAlibaba · poids ouvertsSans7 %65,7
62o3-miniOpenAIÉlevée7 %65,7
62GPT-4.1 miniOpenAINon précisée7 %65,7
65Inkling-SmallThinking Machines · poids ouvertsMaximale6 %65,7
66o4-miniOpenAIÉlevée5 %65,7
66Qwen3-MaxAlibabaNon précisée5 %65,7
68GPT-3.5 Turbo (Jan 2024)OpenAINon précisée3 %65,7
69gpt-oss-120bOpenAI · poids ouverts · 2 configurationsMoyenne2 %65,7

En bref

Que mesure Mystery Game Puzzles ?
100 positions d'un jeu dont Epoch tait le nom, décrites en texte, où le modèle doit trouver le meilleur coup. Sur Quelle IA, il est rangé dans la tâche Raisonnement.
Comment Mystery Game Puzzles est-il noté ?
Part de positions où le coup soumis correspond à la solution ; un coup invalide compte comme faux. Un modèle qui obtient 55 % a un score IA d'environ 95.
Qui est en tête sur Mystery Game Puzzles ?
GPT-6 Astra (OpenAI) est en tête de Mystery Game Puzzles avec 84 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5.5 (71 %) et Claude Sonnet 5.5 (65 %). 69 modèles y sont mesurés.
Quelles sont les limites de Mystery Game Puzzles ?
Ni le nom du jeu, ni les consignes, ni les transcriptions ne sont publiés. Cela limite les fuites mais empêche toute vérification extérieure. Au 28 septembre 2026, le benchmark est actif.
Combien pèse Mystery Game Puzzles dans le score IA ?
Mystery Game Puzzles compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.
Qui maintient Mystery Game Puzzles ?
Epoch AI. Sa page de référence : epoch.ai/benchmarks/mystery-game-puzzles.

Les autres benchmarks de la tâche Raisonnement

Tous les benchmarks →Comment le score IA est calculé →