# Chess Puzzles

> Fiche du benchmark Chess Puzzles sur Quelle IA, édition du 28 septembre 2026. 100 positions d'échecs inédites où il faut trouver le seul meilleur coup, celui que donne le moteur Stockfish. En tête au 28 septembre 2026 : GPT-6 Astra (72 %). Notation, limites et classement des 136 modèles mesurés.

Page : https://quelleia.com/benchmarks/chess_puzzles/
Source du benchmark : https://epoch.ai/benchmarks/chess-puzzles
Mainteneur : Epoch AI
Tâche : Raisonnement
État : actif

## À quoi il sert

Sur Quelle IA, Chess Puzzles sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 95.

## Comment c'est noté

Part de positions où le coup proposé est exactement le bon.

Pour le calcul, ce score est ramené entre 0 et 1 : 5 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Epoch le dit lui-même : bien jouer aux échecs a peu de portée pratique. Le test renseigne sur la planification et la lecture d'une position, rien de plus.

## Qui le tient

Epoch AI.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 52 % a un score IA d'environ 95. Le meilleur, GPT-6 Astra, atteint 72 %. Le benchmark sera dit saturé quand un modèle atteindra 95,2 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 6 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 19 %
- Score IA 100 (niveau de Claude Opus 5.5) : 65 %

## Son poids dans le score IA

1,67 % du score général. Chess Puzzles porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.

## Classement (136 modèles mesurés · 224 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | Maximale | 72 % | 103,4 | https://epoch.ai/benchmarks |
| 2 | [GPT-5.5 Pro](https://quelleia.com/modeles/gpt-5-5-pro.md) | OpenAI | Maximale | 64 % | 99,6 | https://epoch.ai/benchmarks |
| 2 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 64 % | 99,6 | https://epoch.ai/benchmarks |
| 4 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | Élevée | 61 % | 98,2 | https://epoch.ai/benchmarks |
| 5 | [GPT-5.4 Pro](https://quelleia.com/modeles/gpt-5-4-pro.md) | OpenAI | Maximale | 58,6 % | 97,2 | https://epoch.ai/benchmarks |
| 6 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 55 % | 95,6 | https://epoch.ai/benchmarks |
| 7 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 54 % | 95,2 | https://epoch.ai/benchmarks |
| 7 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 54 % | 95,2 | https://epoch.ai/benchmarks |
| 9 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | Élevée | 50 % | 93,4 | https://epoch.ai/benchmarks |
| 10 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Maximale | 49 % | 93,0 | https://epoch.ai/benchmarks |
| 11 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | Maximale | 47 % | 92,2 | https://epoch.ai/benchmarks |
| 11 | [Gemini 3.7 Flash](https://quelleia.com/modeles/gemini-3-7-flash.md) | Google DeepMind | Élevée | 47 % | 92,2 | https://epoch.ai/benchmarks |
| 11 | [DeepSeek V4 Pro 0813](https://quelleia.com/modeles/deepseek-v4-pro-0813.md) | DeepSeek | Maximale | 47 % | 92,2 | https://epoch.ai/benchmarks |
| 14 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 44 % | 90,8 | https://epoch.ai/benchmarks |
| 15 | [Gemini 3.6 Flash](https://quelleia.com/modeles/gemini-3-6-flash.md) | Google DeepMind | Faible | 43 % | 90,4 | https://epoch.ai/benchmarks |
| 16 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 42 % | 89,9 | https://epoch.ai/benchmarks |
| 17 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Élevée | 41 % | 89,5 | https://epoch.ai/benchmarks |
| 18 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | Élevée | 40 % | 89,0 | https://epoch.ai/benchmarks |
| 18 | [Qwen3.8 Max (0902)](https://quelleia.com/modeles/qwen3-8-max-0902.md) | Alibaba | Maximale | 40 % | 89,0 | https://epoch.ai/benchmarks |
| 18 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | Maximale | 40 % | 89,0 | https://epoch.ai/benchmarks |
| 18 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | Élevée | 40 % | 89,0 | https://epoch.ai/benchmarks |
| 22 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | Maximale | 39 % | 88,6 | https://epoch.ai/benchmarks |
| 23 | [Muse Spark 1.3](https://quelleia.com/modeles/muse-spark-1-3.md) | Meta AI | Maximale | 38 % | 88,1 | https://epoch.ai/benchmarks |
| 23 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Moyenne | 38 % | 88,1 | https://epoch.ai/benchmarks |
| 25 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 37 % | 87,6 | https://epoch.ai/benchmarks |
| 26 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | Élevée | 36 % | 87,1 | https://epoch.ai/benchmarks |
| 27 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | Maximale | 35 % | 86,6 | https://epoch.ai/benchmarks |
| 28 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 34 % | 86,1 | https://epoch.ai/benchmarks |
| 29 | [DeepSeek V4 Flash 0731](https://quelleia.com/modeles/deepseek-v4-flash-0731.md) | DeepSeek | Maximale | 33 % | 85,6 | https://epoch.ai/benchmarks |
| 30 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Élevée | 32 % | 85,1 | https://epoch.ai/benchmarks |
| 31 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 31 % | 84,6 | https://epoch.ai/benchmarks |
| 32 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Maximale | 30 % | 84,0 | https://epoch.ai/benchmarks |
| 32 | [GPT-5.4 Nano](https://quelleia.com/modeles/gpt-5-4-nano.md) | OpenAI | Élevée | 30 % | 84,0 | https://epoch.ai/benchmarks |
| 32 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | Élevée | 30 % | 84,0 | https://epoch.ai/benchmarks |
| 35 | [Qwen 3.8 Max](https://quelleia.com/modeles/qwen-3-8-max.md) | Alibaba | Maximale | 29 % | 83,5 | https://epoch.ai/benchmarks |
| 36 | [Grok 4](https://quelleia.com/modeles/grok-4.md) | xAI | non précisée | 28 % | 82,9 | https://epoch.ai/benchmarks |
| 37 | [GPT-5 nano](https://quelleia.com/modeles/gpt-5-nano.md) | OpenAI | Élevée | 27 % | 82,3 | https://epoch.ai/benchmarks |
| 38 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 26 % | 81,7 | https://epoch.ai/benchmarks |
| 38 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Élevée | 26 % | 81,7 | https://epoch.ai/benchmarks |
| 38 | [Qwen 3.6 35B-A3B](https://quelleia.com/modeles/qwen-3-6-35b-a3b.md) | Alibaba | non précisée | 26 % | 81,7 | https://epoch.ai/benchmarks |
| 41 | [Grok 4.3 Beta](https://quelleia.com/modeles/grok-4-3-beta.md) | xAI | Élevée | 25 % | 81,0 | https://epoch.ai/benchmarks |
| 41 | [Gemini 3.1 Flash-Lite](https://quelleia.com/modeles/gemini-3-1-flash-lite.md) | Google DeepMind | Faible | 25 % | 81,0 | https://epoch.ai/benchmarks |
| 43 | [Grok 4.20](https://quelleia.com/modeles/grok-4-20.md) | xAI | non précisée | 24 % | 80,4 | https://epoch.ai/benchmarks |
| 43 | [GPT-5.4 Mini](https://quelleia.com/modeles/gpt-5-4-mini.md) | OpenAI | Maximale | 24 % | 80,4 | https://epoch.ai/benchmarks |
| 43 | [Qwen3.7-Plus](https://quelleia.com/modeles/qwen3-7-plus.md) | Alibaba | non précisée | 24 % | 80,4 | https://epoch.ai/benchmarks |
| 46 | [Qwen3.7 Flash](https://quelleia.com/modeles/qwen3-7-flash.md) | Alibaba | non précisée | 23 % | 79,7 | https://epoch.ai/benchmarks |
| 47 | [Gemini 3.5 Flash-Lite](https://quelleia.com/modeles/gemini-3-5-flash-lite.md) | Google DeepMind | Élevée | 22 % | 79,0 | https://epoch.ai/benchmarks |
| 47 | [Qwen 3.5 Plus (hosted 397B-A17B)](https://quelleia.com/modeles/qwen-3-5-plus-hosted-397b-a17b.md) | Alibaba | non précisée | 22 % | 79,0 | https://epoch.ai/benchmarks |
| 47 | [Qwen3.6 27B](https://quelleia.com/modeles/qwen3-6-27b.md) | Alibaba | non précisée | 22 % | 79,0 | https://epoch.ai/benchmarks |
| 50 | [GLM-5.3](https://quelleia.com/modeles/glm-5-3.md) | Z.ai (Zhipu AI) | Maximale | 21 % | 78,2 | https://epoch.ai/benchmarks |
| 50 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | Maximale | 21 % | 78,2 | https://epoch.ai/benchmarks |
| 50 | [Kimi K2.7 Code](https://quelleia.com/modeles/kimi-k2-7-code.md) | Moonshot | non précisée | 21 % | 78,2 | https://epoch.ai/benchmarks |
| 50 | [Inkling](https://quelleia.com/modeles/inkling.md) | Thinking Machines | Maximale | 21 % | 78,2 | https://epoch.ai/benchmarks |
| 50 | [Qwen 3.5 Flash (hosted 35B-A3B)](https://quelleia.com/modeles/qwen-3-5-flash-hosted-35b-a3b.md) | Alibaba | non précisée | 21 % | 78,2 | https://epoch.ai/benchmarks |
| 55 | [DeepSeek-V4-Pro](https://quelleia.com/modeles/deepseek-v4-pro.md) | DeepSeek | Maximale | 20 % | 77,5 | https://epoch.ai/benchmarks |
| 55 | [Qwen 3.6 Max (Preview)](https://quelleia.com/modeles/qwen-3-6-max-preview.md) | Alibaba | non précisée | 20 % | 77,5 | https://epoch.ai/benchmarks |
| 55 | [Kimi K2 Thinking](https://quelleia.com/modeles/kimi-k2-thinking.md) | Moonshot | non précisée | 20 % | 77,5 | https://epoch.ai/benchmarks |
| 55 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 20 % | 77,5 | https://epoch.ai/benchmarks |
| 55 | [Qwen 3.6 Flash](https://quelleia.com/modeles/qwen-3-6-flash.md) | Alibaba | non précisée | 20 % | 77,5 | https://epoch.ai/benchmarks |
| 55 | [gpt-oss-120b](https://quelleia.com/modeles/gpt-oss-120b.md) | OpenAI | Élevée | 20 % | 77,5 | https://epoch.ai/benchmarks |
| 61 | [Qwen3.7-Max](https://quelleia.com/modeles/qwen3-7-max.md) | Alibaba | non précisée | 19 % | 76,6 | https://epoch.ai/benchmarks |
| 61 | [GLM-5.1](https://quelleia.com/modeles/glm-5-1.md) | Z.ai (Zhipu AI) | non précisée | 19 % | 76,6 | https://epoch.ai/benchmarks |
| 63 | [Inkling-Small](https://quelleia.com/modeles/inkling-small.md) | Thinking Machines | Maximale | 18 % | 75,8 | https://epoch.ai/benchmarks |
| 64 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Budget | 17 % | 74,8 | https://epoch.ai/benchmarks |
| 64 | [Qwen 3.6 Plus](https://quelleia.com/modeles/qwen-3-6-plus.md) | Alibaba | non précisée | 17 % | 74,8 | https://epoch.ai/benchmarks |
| 64 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 17 % | 74,8 | https://epoch.ai/benchmarks |
| 67 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Élevée | 15 % | 72,7 | https://epoch.ai/benchmarks |
| 68 | [GLM-5.3-Flash](https://quelleia.com/modeles/glm-5-3-flash.md) | Z.ai (Zhipu AI) | Maximale | 14 % | 71,5 | https://epoch.ai/benchmarks |
| 68 | [MiniMax-M3](https://quelleia.com/modeles/minimax-m3.md) | MiniMax | non précisée | 14 % | 71,5 | https://epoch.ai/benchmarks |
| 68 | [DeepSeek-V3.2](https://quelleia.com/modeles/deepseek-v3-2.md) | DeepSeek | non précisée | 14 % | 71,5 | https://epoch.ai/benchmarks |
| 71 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | Budget | 13 % | 70,2 | https://epoch.ai/benchmarks |
| 71 | [Qwen3.5 397B-A17B](https://quelleia.com/modeles/qwen3-5-397b-a17b.md) | Alibaba | Sans | 13 % | 70,2 | https://epoch.ai/benchmarks |
| 71 | [seed-oss-36b-instruct](https://quelleia.com/modeles/seed-oss-36b-instruct.md) | ByteDance | non précisée | 13 % | 70,2 | https://epoch.ai/benchmarks |
| 71 | [GPT-4o (Aug 2024)](https://quelleia.com/modeles/gpt-4o-aug-2024.md) | OpenAI | non précisée | 13 % | 70,2 | https://epoch.ai/benchmarks |
| 75 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | Budget | 12 % | 68,7 | https://epoch.ai/benchmarks |
| 75 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 12 % | 68,7 | https://epoch.ai/benchmarks |
| 75 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | Budget | 12 % | 68,7 | https://epoch.ai/benchmarks |
| 75 | [GPT-5.5 Instant](https://quelleia.com/modeles/gpt-5-5-instant.md) | OpenAI | non précisée | 12 % | 68,7 | https://epoch.ai/benchmarks |
| 75 | [Nemotron 3 Ultra](https://quelleia.com/modeles/nemotron-3-ultra.md) | NVIDIA | non précisée | 12 % | 68,7 | https://epoch.ai/benchmarks |
| 75 | [Qwen3-235B-A22B-Thinking (Jul 2025)](https://quelleia.com/modeles/qwen3-235b-a22b-thinking-jul-2025.md) | Alibaba | non précisée | 12 % | 68,7 | https://epoch.ai/benchmarks |
| 75 | [Qwen3.5-9B](https://quelleia.com/modeles/qwen3-5-9b.md) | Alibaba | Sans | 12 % | 68,7 | https://epoch.ai/benchmarks |
| 82 | [GLM-5](https://quelleia.com/modeles/glm-5.md) | Z.ai (Zhipu AI) | non précisée | 10 % | 65,1 | https://epoch.ai/benchmarks |
| 82 | [Qwen3.5-35B-A3B](https://quelleia.com/modeles/qwen3-5-35b-a3b.md) | Alibaba | Sans | 10 % | 65,1 | https://epoch.ai/benchmarks |
| 84 | [Claude Haiku 4.5](https://quelleia.com/modeles/claude-haiku-4-5.md) | Anthropic | Budget | 8 % | 59,7 | https://epoch.ai/benchmarks |
| 84 | [Qwen3-30B-A3B-Thinking (Jul 2025)](https://quelleia.com/modeles/qwen3-30b-a3b-thinking-jul-2025.md) | Alibaba | non précisée | 8 % | 59,7 | https://epoch.ai/benchmarks |
| 86 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | non précisée | 7 % | 55,5 | https://epoch.ai/benchmarks |
| 86 | [GPT-4.1 mini](https://quelleia.com/modeles/gpt-4-1-mini.md) | OpenAI | non précisée | 7 % | 55,5 | https://epoch.ai/benchmarks |
| 88 | [GLM-4.7](https://quelleia.com/modeles/glm-4-7.md) | Z.ai (Zhipu AI) | non précisée | 6 % | 48,6 | https://epoch.ai/benchmarks |
| 88 | [Gemma 4 26B A4B](https://quelleia.com/modeles/gemma-4-26b-a4b.md) | Google DeepMind | Faible | 6 % | 48,6 | https://epoch.ai/benchmarks |
| 88 | [GPT-4.1](https://quelleia.com/modeles/gpt-4-1.md) | OpenAI | non précisée | 6 % | 48,6 | https://epoch.ai/benchmarks |
| 88 | [GPT-4 Turbo (Apr 2024)](https://quelleia.com/modeles/gpt-4-turbo-apr-2024.md) | OpenAI | non précisée | 6 % | 48,6 | https://epoch.ai/benchmarks |
| 92 | [Gemma 4 31B IT](https://quelleia.com/modeles/gemma-4-31b-it.md) | Google DeepMind | Faible | 5 % | 47,6 | https://epoch.ai/benchmarks |
| 92 | [Qwen3-32B](https://quelleia.com/modeles/qwen3-32b.md) | Alibaba | non précisée | 5 % | 47,6 | https://epoch.ai/benchmarks |
| 92 | [QwQ-32B](https://quelleia.com/modeles/qwq-32b.md) | Alibaba | non précisée | 5 % | 47,6 | https://epoch.ai/benchmarks |
| 92 | [Qwen3-8B](https://quelleia.com/modeles/qwen3-8b.md) | Alibaba | non précisée | 5 % | 47,6 | https://epoch.ai/benchmarks |
| 92 | [Claude 3 Opus](https://quelleia.com/modeles/claude-3-opus.md) | Anthropic | non précisée | 5 % | 47,6 | https://epoch.ai/benchmarks |
| 97 | [Qwen3-Max](https://quelleia.com/modeles/qwen3-max.md) | Alibaba | non précisée | 4 % | 47,6 | https://epoch.ai/benchmarks |
| 97 | [Qwen3-14B](https://quelleia.com/modeles/qwen3-14b.md) | Alibaba | non précisée | 4 % | 47,6 | https://epoch.ai/benchmarks |
| 97 | [gpt-oss-20b](https://quelleia.com/modeles/gpt-oss-20b.md) | OpenAI | Moyenne | 4 % | 47,6 | https://epoch.ai/benchmarks |
| 97 | [Qwen3-30B-A3B](https://quelleia.com/modeles/qwen3-30b-a3b.md) | Alibaba | non précisée | 4 % | 47,6 | https://epoch.ai/benchmarks |
| 97 | [qwen3-4b-instruct-2507](https://quelleia.com/modeles/qwen3-4b-instruct-2507.md) | Alibaba | non précisée | 4 % | 47,6 | https://epoch.ai/benchmarks |
| 97 | [GPT-4 (Jun 2023)](https://quelleia.com/modeles/gpt-4-jun-2023.md) | OpenAI | non précisée | 4 % | 47,6 | https://epoch.ai/benchmarks |
| 103 | [Magistral Small 1.2](https://quelleia.com/modeles/magistral-small-1-2.md) | Mistral AI | non précisée | 3 % | 47,6 | https://epoch.ai/benchmarks |
| 103 | [deepseek-r1-0528-qwen3-8b](https://quelleia.com/modeles/deepseek-r1-0528-qwen3-8b.md) | DeepSeek | non précisée | 3 % | 47,6 | https://epoch.ai/benchmarks |
| 105 | [Qwen3-30B-A3B-Instruct (Jul 2025)](https://quelleia.com/modeles/qwen3-30b-a3b-instruct-jul-2025.md) | Alibaba | non précisée | 2 % | 47,6 | https://epoch.ai/benchmarks |
| 106 | [DeepSeek-R1-Distill-Qwen-32B](https://quelleia.com/modeles/deepseek-r1-distill-qwen-32b.md) | DeepSeek | non précisée | 1 % | 47,6 | https://epoch.ai/benchmarks |
| 106 | [DeepSeek-R1-Distill-Qwen-14B](https://quelleia.com/modeles/deepseek-r1-distill-qwen-14b.md) | DeepSeek | non précisée | 1 % | 47,6 | https://epoch.ai/benchmarks |
| 106 | [Mistral Small 3.2](https://quelleia.com/modeles/mistral-small-3-2.md) | Mistral AI | non précisée | 1 % | 47,6 | https://epoch.ai/benchmarks |
| 106 | [Qwen3-4B](https://quelleia.com/modeles/qwen3-4b.md) | Alibaba | Sans | 1 % | 47,6 | https://epoch.ai/benchmarks |
| 106 | [Mistral Small 3.1](https://quelleia.com/modeles/mistral-small-3-1.md) | Mistral AI | non précisée | 1 % | 47,6 | https://epoch.ai/benchmarks |
| 106 | [Phi-4](https://quelleia.com/modeles/phi-4.md) | Microsoft | non précisée | 1 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [glm-4.7-flash](https://quelleia.com/modeles/glm-4-7-flash.md) | Z.ai (Zhipu AI) | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [Gemma 3 27B](https://quelleia.com/modeles/gemma-3-27b.md) | Google DeepMind | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [glm-4.7-flash_none](https://quelleia.com/modeles/glm-4-7-flash-none.md) | Z.ai (Zhipu AI) | Sans | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [Gemma 3 12B](https://quelleia.com/modeles/gemma-3-12b.md) | Google DeepMind | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [Qwen2.5-32B](https://quelleia.com/modeles/qwen2-5-32b.md) | Alibaba | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [Mistral Small 3](https://quelleia.com/modeles/mistral-small-3.md) | Mistral AI | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [Gemma 3 4B](https://quelleia.com/modeles/gemma-3-4b.md) | Google DeepMind | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [Qwen2.5-7B](https://quelleia.com/modeles/qwen2-5-7b.md) | Alibaba | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [granite-4.0-micro](https://quelleia.com/modeles/granite-4-0-micro.md) | IBM | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [Qwen3-1.7B](https://quelleia.com/modeles/qwen3-1-7b.md) | Alibaba | Sans | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [GPT-3.5 Turbo (Jan 2024)](https://quelleia.com/modeles/gpt-3-5-turbo-jan-2024.md) | OpenAI | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [Llama 3.1-8B](https://quelleia.com/modeles/llama-3-1-8b.md) | Meta AI | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [Llama 3-8B](https://quelleia.com/modeles/llama-3-8b.md) | Meta AI | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [Qwen3.5-2B](https://quelleia.com/modeles/qwen3-5-2b.md) | Alibaba | Sans | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [granite-4.0-1b](https://quelleia.com/modeles/granite-4-0-1b.md) | IBM | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [granite-4.0-350m](https://quelleia.com/modeles/granite-4-0-350m.md) | IBM | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [DeepSeek LLM 67B](https://quelleia.com/modeles/deepseek-llm-67b.md) | DeepSeek | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [phi-3-mini 3.8B](https://quelleia.com/modeles/phi-3-mini-3-8b.md) | Microsoft | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [Mistral 7B v0.3](https://quelleia.com/modeles/mistral-7b-v0-3.md) | Mistral AI | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [Llama 2-13B](https://quelleia.com/modeles/llama-2-13b.md) | Meta AI | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [Llama 2-7B](https://quelleia.com/modeles/llama-2-7b.md) | Meta AI | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [DeepSeek-R1-Distill-Qwen-1.5B](https://quelleia.com/modeles/deepseek-r1-distill-qwen-1-5b.md) | DeepSeek | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [Gemma 3 1B](https://quelleia.com/modeles/gemma-3-1b.md) | Google DeepMind | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |
| 112 | [Llama 3.2 1B](https://quelleia.com/modeles/llama-3-2-1b.md) | Meta AI | non précisée | 0 % | 47,6 | https://epoch.ai/benchmarks |

## En bref

**Que mesure Chess Puzzles ?** 100 positions d'échecs inédites où il faut trouver le seul meilleur coup, celui que donne le moteur Stockfish. Sur Quelle IA, il est rangé dans la tâche Raisonnement.

**Comment Chess Puzzles est-il noté ?** Part de positions où le coup proposé est exactement le bon. Un modèle qui obtient 52 % a un score IA d'environ 95.

**Qui est en tête sur Chess Puzzles ?** GPT-6 Astra (OpenAI) est en tête de Chess Puzzles avec 72 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.5 Pro (64 %) et GPT-5.6 Sol (64 %). 136 modèles y sont mesurés.

**Quelles sont les limites de Chess Puzzles ?** Epoch le dit lui-même : bien jouer aux échecs a peu de portée pratique. Le test renseigne sur la planification et la lecture d'une position, rien de plus. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse Chess Puzzles dans le score IA ?** Chess Puzzles compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.

**Qui maintient Chess Puzzles ?** Epoch AI. Sa page de référence : epoch.ai/benchmarks/chess-puzzles.

## Les autres benchmarks de la tâche Raisonnement

- [DTBench](https://quelleia.com/benchmarks/dtbench.md) : 168 modèles · 1,67 % du score, saturé
- [LMCA](https://quelleia.com/benchmarks/lmca.md) : 130 modèles · 1,67 % du score
- [ARC-AGI-1](https://quelleia.com/benchmarks/arc_agi.md) : 82 modèles · 1,67 % du score, saturé
- [SimpleBench](https://quelleia.com/benchmarks/simplebench.md) : 82 modèles · 1,67 % du score
- [ARC-AGI-2](https://quelleia.com/benchmarks/arc_agi_2.md) : 80 modèles · 1,67 % du score, saturé
- [ForecastBench](https://quelleia.com/benchmarks/forecastbench.md) : 77 modèles · 1,67 % du score
- [Mystery Game Puzzles](https://quelleia.com/benchmarks/mystery_game_puzzles.md) : 69 modèles · 1,67 % du score
- [EnigmaEval](https://quelleia.com/benchmarks/enigmaeval.md) : 41 modèles · 1,67 % du score
- [LiveBench, raisonnement](https://quelleia.com/benchmarks/livebench_raisonnement.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
