Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

RaisonnementFiche benchmark · Epoch AI · epoch.ai

Chess Puzzles

100 positions d'échecs inédites où il faut trouver le seul meilleur coup, celui que donne le moteur Stockfish.

À quoi il sert

Sur Quelle IA, Chess Puzzles sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 95.

Comment c'est noté

Part de positions où le coup proposé est exactement le bon.

Pour le calcul, ce score est ramené entre 0 et 1 : 5 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Epoch le dit lui-même : bien jouer aux échecs a peu de portée pratique. Le test renseigne sur la planification et la lecture d'une position, rien de plus.

Comment lire le score

136 modèles mesurés · 224 mesures

En tête : GPT-6 Astra, 72 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 52 % a un score IA d'environ 95. Le meilleur, GPT-6 Astra, atteint 72 %. Le benchmark sera dit saturé quand un modèle atteindra 95,2 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
6 %
Score IA 76niveau de Claude Sonnet 4.5
19 %
Score IA 100niveau de Claude Opus 5.5
65 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. Chess Puzzles porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.

En couleur, la tâche Raisonnement dans le score général. En noir, la part de Chess Puzzles.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAIMaximale72 %103,4
2GPT-5.5 ProOpenAIMaximale64 %99,6
2GPT-5.6 SolOpenAI · 4 configurationsMaximale64 %99,6
4Gemini 3.8 FlashGoogle DeepMindÉlevée61 %98,2
5GPT-5.4 ProOpenAIMaximale58,6 %97,2
6Gemini 3.1 ProGoogle DeepMind · 2 configurationsNon précisée55 %95,6
7GPT-5.6 TerraOpenAI · 3 configurationsMaximale54 %95,2
7GPT-5.5OpenAI · 3 configurationsMaximale54 %95,2
9Gemini 3.5 FlashGoogle DeepMind · 3 configurationsÉlevée50 %93,4
10GPT-5.2OpenAI · 5 configurationsMaximale49 %93,0
136 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 136 →Replier le classement ↑
11Claude Fable 5.1AnthropicMaximale47 %92,2
11Gemini 3.7 FlashGoogle DeepMindÉlevée47 %92,2
11DeepSeek V4 Pro 0813DeepSeek · poids ouvertsMaximale47 %92,2
14GPT-5.4OpenAI · 5 configurationsMaximale44 %90,8
15Gemini 3.6 FlashGoogle DeepMind · 3 configurationsFaible43 %90,4
16Claude Opus 5Anthropic · 3 configurationsMaximale42 %89,9
17Claude Fable 5Anthropic · 3 configurationsÉlevée41 %89,5
18Grok 4.6xAI · 2 configurationsÉlevée40 %89,0
18Qwen3.8 Max (0902)AlibabaMaximale40 %89,0
18GPT-5.6 LunaOpenAI · 3 configurationsMaximale40 %89,0
18Gemini 3 FlashGoogle DeepMind · 2 configurationsÉlevée40 %89,0
22Kimi K3Moonshot · poids ouverts · 3 configurationsMaximale39 %88,6
23Muse Spark 1.3Meta AI · 2 configurationsMaximale38 %88,1
23o3OpenAI · 3 configurationsMoyenne38 %88,1
25GPT-5OpenAI · 4 configurationsÉlevée37 %87,6
26Grok 4.5xAIÉlevée36 %87,1
27Claude Sonnet 5Anthropic · 2 configurationsMaximale35 %86,6
28Claude Opus 4.8Anthropic · 3 configurationsMaximale34 %86,1
29DeepSeek V4 Flash 0731DeepSeek · poids ouvertsMaximale33 %85,6
30GPT-5.1OpenAI · 3 configurationsÉlevée32 %85,1
31Gemini 3 ProGoogle DeepMindNon précisée31 %84,6
32Claude Opus 4.7Anthropic · 3 configurationsMaximale30 %84,0
32GPT-5.4 NanoOpenAI · 3 configurationsÉlevée30 %84,0
32GPT-5 miniOpenAI · 3 configurationsÉlevée30 %84,0
35Qwen 3.8 MaxAlibabaMaximale29 %83,5
36Grok 4xAINon précisée28 %82,9
37GPT-5 nanoOpenAI · 3 configurationsÉlevée27 %82,3
38Kimi K2.6Moonshot · poids ouvertsNon précisée26 %81,7
38o4-miniOpenAI · 3 configurationsÉlevée26 %81,7
38Qwen 3.6 35B-A3BAlibaba · poids ouverts · 2 configurationsNon précisée26 %81,7
41Grok 4.3 BetaxAIÉlevée25 %81,0
41Gemini 3.1 Flash-LiteGoogle DeepMind · 3 configurationsFaible25 %81,0
43Grok 4.20xAINon précisée24 %80,4
43GPT-5.4 MiniOpenAI · 3 configurationsMaximale24 %80,4
43Qwen3.7-PlusAlibaba · 2 configurationsNon précisée24 %80,4
46Qwen3.7 FlashAlibaba · 2 configurationsNon précisée23 %79,7
47Gemini 3.5 Flash-LiteGoogle DeepMind · 3 configurationsÉlevée22 %79,0
47Qwen 3.5 Plus (hosted 397B-A17B)AlibabaNon précisée22 %79,0
47Qwen3.6 27BAlibaba · poids ouverts · 2 configurationsNon précisée22 %79,0
50GLM-5.3Z.ai (Zhipu AI) · poids ouvertsMaximale21 %78,2
50GLM-5.2Z.ai (Zhipu AI) · poids ouverts · 3 configurationsMaximale21 %78,2
50Kimi K2.7 CodeMoonshot · poids ouvertsNon précisée21 %78,2
50InklingThinking Machines · poids ouvertsMaximale21 %78,2
50Qwen 3.5 Flash (hosted 35B-A3B)AlibabaNon précisée21 %78,2
55DeepSeek-V4-ProDeepSeek · poids ouverts · 3 configurationsMaximale20 %77,5
55Qwen 3.6 Max (Preview)AlibabaNon précisée20 %77,5
55Kimi K2 ThinkingMoonshot · poids ouvertsNon précisée20 %77,5
55Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée20 %77,5
55Qwen 3.6 FlashAlibabaNon précisée20 %77,5
55gpt-oss-120bOpenAI · poids ouvertsÉlevée20 %77,5
61Qwen3.7-MaxAlibabaNon précisée19 %76,6
61GLM-5.1Z.ai (Zhipu AI) · poids ouvertsNon précisée19 %76,6
63Inkling-SmallThinking Machines · poids ouvertsMaximale18 %75,8
64Claude Opus 4.6Anthropic · 4 configurationsBudget17 %74,8
64Qwen 3.6 PlusAlibabaNon précisée17 %74,8
64o3-miniOpenAI · 3 configurationsÉlevée17 %74,8
67o1OpenAI · 3 configurationsÉlevée15 %72,7
68GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsMaximale14 %71,5
68MiniMax-M3MiniMax · poids ouverts · 2 configurationsNon précisée14 %71,5
68DeepSeek-V3.2DeepSeek · poids ouverts · 2 configurationsNon précisée14 %71,5
71Claude Sonnet 4.6Anthropic · 4 configurationsBudget13 %70,2
71Qwen3.5 397B-A17BAlibaba · poids ouverts · 2 configurationsSans13 %70,2
71seed-oss-36b-instructByteDanceNon précisée13 %70,2
71GPT-4o (Aug 2024)OpenAINon précisée13 %70,2
75Claude Opus 4.5Anthropic · 2 configurationsBudget12 %68,7
75Kimi K2.5Moonshot · poids ouvertsNon précisée12 %68,7
75Claude Sonnet 4.5Anthropic · 2 configurationsBudget12 %68,7
75GPT-5.5 InstantOpenAINon précisée12 %68,7
75Nemotron 3 UltraNVIDIA · poids ouvertsNon précisée12 %68,7
75Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée12 %68,7
75Qwen3.5-9BAlibaba · poids ouverts · 2 configurationsSans12 %68,7
82GLM-5Z.ai (Zhipu AI) · poids ouvertsNon précisée10 %65,1
82Qwen3.5-35B-A3BAlibaba · poids ouverts · 2 configurationsSans10 %65,1
84Claude Haiku 4.5AnthropicBudget8 %59,7
84Qwen3-30B-A3B-Thinking (Jul 2025)Alibaba · poids ouvertsNon précisée8 %59,7
86Claude Opus 4.1AnthropicNon précisée7 %55,5
86GPT-4.1 miniOpenAINon précisée7 %55,5
88GLM-4.7Z.ai (Zhipu AI) · poids ouvertsNon précisée6 %48,6
88Gemma 4 26B A4BGoogle DeepMind · poids ouvertsFaible6 %48,6
88GPT-4.1OpenAINon précisée6 %48,6
88GPT-4 Turbo (Apr 2024)OpenAINon précisée6 %48,6
92Gemma 4 31B ITGoogle DeepMind · poids ouvertsFaible5 %47,6
92Qwen3-32BAlibaba · poids ouverts · 2 configurationsNon précisée5 %47,6
92QwQ-32BAlibaba · poids ouvertsNon précisée5 %47,6
92Qwen3-8BAlibaba · poids ouverts · 2 configurationsNon précisée5 %47,6
92Claude 3 OpusAnthropicNon précisée5 %47,6
97Qwen3-MaxAlibabaNon précisée4 %47,6
97Qwen3-14BAlibaba · poids ouverts · 2 configurationsNon précisée4 %47,6
97gpt-oss-20bOpenAI · poids ouverts · 3 configurationsMoyenne4 %47,6
97Qwen3-30B-A3BAlibaba · poids ouverts · 2 configurationsNon précisée4 %47,6
97qwen3-4b-instruct-2507AlibabaNon précisée4 %47,6
97GPT-4 (Jun 2023)OpenAINon précisée4 %47,6
103Magistral Small 1.2Mistral AI · poids ouvertsNon précisée3 %47,6
103deepseek-r1-0528-qwen3-8bDeepSeek · poids ouvertsNon précisée3 %47,6
105Qwen3-30B-A3B-Instruct (Jul 2025)Alibaba · poids ouvertsNon précisée2 %47,6
106DeepSeek-R1-Distill-Qwen-32BDeepSeekNon précisée1 %47,6
106DeepSeek-R1-Distill-Qwen-14BDeepSeekNon précisée1 %47,6
106Mistral Small 3.2Mistral AI · poids ouvertsNon précisée1 %47,6
106Qwen3-4BAlibaba · poids ouvertsSans1 %47,6
106Mistral Small 3.1Mistral AINon précisée1 %47,6
106Phi-4Microsoft · poids ouvertsNon précisée1 %47,6
112glm-4.7-flashZ.ai (Zhipu AI) · poids ouvertsNon précisée0 %47,6
112Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée0 %47,6
112glm-4.7-flash_noneZ.ai (Zhipu AI)Sans0 %47,6
112Gemma 3 12BGoogle DeepMind · poids ouvertsNon précisée0 %47,6
112Qwen2.5-32BAlibaba · poids ouvertsNon précisée0 %47,6
112GPT-4o miniOpenAINon précisée0 %47,6
112Mistral Small 3Mistral AINon précisée0 %47,6
112Gemma 3 4BGoogle DeepMind · poids ouvertsNon précisée0 %47,6
112Qwen2.5-7BAlibaba · poids ouvertsNon précisée0 %47,6
112granite-4.0-microIBM · poids ouvertsNon précisée0 %47,6
112Qwen3-1.7BAlibabaSans0 %47,6
112GPT-3.5 Turbo (Jan 2024)OpenAINon précisée0 %47,6
112Llama 3.1-8BMeta AI · poids ouvertsNon précisée0 %47,6
112Llama 3-8BMeta AI · poids ouvertsNon précisée0 %47,6
112Qwen3.5-2BAlibaba · poids ouvertsSans0 %47,6
112granite-4.0-1bIBMNon précisée0 %47,6
112granite-4.0-350mIBMNon précisée0 %47,6
112DeepSeek LLM 67BDeepSeek · poids ouvertsNon précisée0 %47,6
112phi-3-mini 3.8BMicrosoft · poids ouvertsNon précisée0 %47,6
112Mistral 7B v0.3Mistral AI · poids ouvertsNon précisée0 %47,6
112Llama 2-13BMeta AI · poids ouvertsNon précisée0 %47,6
112Llama 2-7BMeta AI · poids ouvertsNon précisée0 %47,6
112DeepSeek-R1-Distill-Qwen-1.5BDeepSeekNon précisée0 %47,6
112Gemma 3 1BGoogle DeepMind · poids ouvertsNon précisée0 %47,6
112Llama 3.2 1BMeta AI · poids ouvertsNon précisée0 %47,6

En bref

Que mesure Chess Puzzles ?
100 positions d'échecs inédites où il faut trouver le seul meilleur coup, celui que donne le moteur Stockfish. Sur Quelle IA, il est rangé dans la tâche Raisonnement.
Comment Chess Puzzles est-il noté ?
Part de positions où le coup proposé est exactement le bon. Un modèle qui obtient 52 % a un score IA d'environ 95.
Qui est en tête sur Chess Puzzles ?
GPT-6 Astra (OpenAI) est en tête de Chess Puzzles avec 72 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.5 Pro (64 %) et GPT-5.6 Sol (64 %). 136 modèles y sont mesurés.
Quelles sont les limites de Chess Puzzles ?
Epoch le dit lui-même : bien jouer aux échecs a peu de portée pratique. Le test renseigne sur la planification et la lecture d'une position, rien de plus. Au 28 septembre 2026, le benchmark est actif.
Combien pèse Chess Puzzles dans le score IA ?
Chess Puzzles compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.
Qui maintient Chess Puzzles ?
Epoch AI. Sa page de référence : epoch.ai/benchmarks/chess-puzzles.

Les autres benchmarks de la tâche Raisonnement

Tous les benchmarks →Comment le score IA est calculé →