# SimpleBench

> Fiche du benchmark SimpleBench sur Quelle IA, édition du 28 septembre 2026. 213 questions pièges de bon sens, sur l'espace, le temps et les relations sociales, qu'un adulte réussit dans 84 % des cas. En tête au 28 septembre 2026 : Claude Fable 5 (81,9 %). Notation, limites et classement des 82 modèles mesurés.

Page : https://quelleia.com/benchmarks/simplebench/
Source du benchmark : https://simple-bench.com/
Mainteneur : Équipe SimpleBench (chaîne YouTube AI Explained)
Tâche : Raisonnement
État : actif

## À quoi il sert

Sur Quelle IA, SimpleBench sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 82.

## Comment c'est noté

Part de bonnes réponses à six choix, en moyenne sur cinq passages ; le hasard donne 17 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 17 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

L'essentiel des questions est privé, ce qui limite les fuites mais interdit toute vérification. Les meilleurs modèles rejoignent le niveau humain mesuré.

## Qui le tient

Équipe SimpleBench (chaîne YouTube AI Explained).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 58 % a un score IA d'environ 82. Le meilleur, Claude Fable 5, atteint 81,9 %. Le benchmark sera dit saturé quand un modèle atteindra 95,8 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 25 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 50 %
- Score IA 100 (niveau de Claude Opus 5.5) : 82 %

## Son poids dans le score IA

1,67 % du score général. SimpleBench porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.

## Classement (82 modèles mesurés · 102 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Maximale | 81,9 % | 100,2 | https://epoch.ai/benchmarks |
| 2 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | non précisée | 80,6 % | 98,9 | https://lmcouncil.ai/benchmarks |
| 3 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 79,6 % | 98,0 | https://lmcouncil.ai/benchmarks |
| 4 | [GPT-5.5 Pro](https://quelleia.com/modeles/gpt-5-5-pro.md) | OpenAI | non précisée | 76,9 % | 95,6 | https://lmcouncil.ai/benchmarks |
| 5 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | non précisée | 76,7 % | 95,5 | https://epoch.ai/benchmarks |
| 6 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 76,4 % | 95,2 | https://lmcouncil.ai/benchmarks |
| 7 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | non précisée | 75,9 % | 94,8 | https://lmcouncil.ai/benchmarks |
| 8 | [Muse Spark 1.2](https://quelleia.com/modeles/muse-spark-1-2.md) | Meta AI | non précisée | 74,5 % | 93,7 | https://lmcouncil.ai/benchmarks |
| 9 | [GPT-5.4 Pro](https://quelleia.com/modeles/gpt-5-4-pro.md) | OpenAI | non précisée | 74,1 % | 93,4 | https://epoch.ai/benchmarks |
| 10 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | non précisée | 71,7 % | 91,5 | https://lmcouncil.ai/benchmarks |
| 11 | [Qwen3.7-Max](https://quelleia.com/modeles/qwen3-7-max.md) | Alibaba | non précisée | 70,4 % | 90,6 | https://epoch.ai/benchmarks |
| 12 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | non précisée | 70 % | 90,3 | https://lmcouncil.ai/benchmarks |
| 13 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | non précisée | 69 % | 89,5 | https://lmcouncil.ai/benchmarks |
| 14 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | non précisée | 67,6 % | 88,5 | https://lmcouncil.ai/benchmarks |
| 15 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | non précisée | 64,8 % | 86,6 | https://lmcouncil.ai/benchmarks |
| 16 | [Qwen 3.6 Max (Preview)](https://quelleia.com/modeles/qwen-3-6-max-preview.md) | Alibaba | non précisée | 63 % | 85,4 | https://epoch.ai/benchmarks |
| 17 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 62,4 % | 85,0 | https://lmcouncil.ai/benchmarks |
| 18 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | non précisée | 62 % | 84,7 | https://epoch.ai/benchmarks |
| 19 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | non précisée | 61,7 % | 84,5 | https://lmcouncil.ai/benchmarks |
| 20 | [GPT-5 Pro](https://quelleia.com/modeles/gpt-5-pro.md) | OpenAI | Élevée | 61,6 % | 84,4 | https://epoch.ai/benchmarks |
| 21 | [DeepSeek V4 Flash 0731](https://quelleia.com/modeles/deepseek-v4-flash-0731.md) | DeepSeek | non précisée | 61,1 % | 84,1 | https://lmcouncil.ai/benchmarks |
| 21 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | non précisée | 61,1 % | 84,1 | https://lmcouncil.ai/benchmarks |
| 23 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | Maximale | 60,7 % | 83,8 | https://lmcouncil.ai/benchmarks |
| 24 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | non précisée | 60,6 % | 83,7 | https://epoch.ai/benchmarks |
| 25 | [Grok 4](https://quelleia.com/modeles/grok-4.md) | xAI | non précisée | 60,5 % | 83,7 | https://lmcouncil.ai/benchmarks |
| 26 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | non précisée | 60 % | 83,3 | https://epoch.ai/benchmarks |
| 27 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | non précisée | 58,8 % | 82,5 | https://lmcouncil.ai/benchmarks |
| 27 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | Budget | 58,8 % | 82,5 | https://epoch.ai/benchmarks |
| 29 | [Kimi K2.7 Code](https://quelleia.com/modeles/kimi-k2-7-code.md) | Moonshot | non précisée | 57,9 % | 81,9 | https://lmcouncil.ai/benchmarks |
| 30 | [GPT-5.2 Pro](https://quelleia.com/modeles/gpt-5-2-pro.md) | OpenAI | non précisée | 57,4 % | 81,6 | https://lmcouncil.ai/benchmarks |
| 31 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 56,7 % | 81,1 | https://lmcouncil.ai/benchmarks |
| 32 | [Grok 4.1 Fast](https://quelleia.com/modeles/grok-4-1-fast.md) | xAI | non précisée | 56 % | 80,6 | https://epoch.ai/benchmarks |
| 33 | [GLM-5.1](https://quelleia.com/modeles/glm-5-1.md) | Z.ai (Zhipu AI) | non précisée | 55,1 % | 80,0 | https://epoch.ai/benchmarks |
| 34 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | non précisée | 54,3 % | 79,5 | https://epoch.ai/benchmarks |
| 35 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Élevée | 53,2 % | 78,7 | https://lmcouncil.ai/benchmarks |
| 35 | [GLM-5](https://quelleia.com/modeles/glm-5.md) | Z.ai (Zhipu AI) | non précisée | 53,2 % | 78,7 | https://epoch.ai/benchmarks |
| 37 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Élevée | 53,1 % | 78,7 | https://epoch.ai/benchmarks |
| 38 | [DeepSeek-V3.2-Speciale](https://quelleia.com/modeles/deepseek-v3-2-speciale.md) | DeepSeek | non précisée | 52,6 % | 78,3 | https://epoch.ai/benchmarks |
| 39 | [Gemini 2.5 Pro (Mar 2025)](https://quelleia.com/modeles/gemini-2-5-pro-mar-2025.md) | Google DeepMind | non précisée | 51,6 % | 77,6 | https://epoch.ai/benchmarks |
| 40 | [Inkling](https://quelleia.com/modeles/inkling.md) | Thinking Machines | non précisée | 50 % | 76,5 | https://lmcouncil.ai/benchmarks |
| 41 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 48,9 % | 75,8 | https://lmcouncil.ai/benchmarks |
| 42 | [GLM-4.7](https://quelleia.com/modeles/glm-4-7.md) | Z.ai (Zhipu AI) | non précisée | 47,7 % | 74,9 | https://epoch.ai/benchmarks |
| 43 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | non précisée | 46,8 % | 74,2 | https://epoch.ai/benchmarks |
| 44 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 46,8 % | 74,2 | https://epoch.ai/benchmarks |
| 45 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | Budget | 46,4 % | 74,0 | https://epoch.ai/benchmarks |
| 46 | [DeepSeek-V4-Flash](https://quelleia.com/modeles/deepseek-v4-flash.md) | DeepSeek | non précisée | 46,3 % | 73,9 | https://lmcouncil.ai/benchmarks |
| 47 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Élevée | 45,8 % | 73,5 | https://epoch.ai/benchmarks |
| 48 | [MiniMax-M3](https://quelleia.com/modeles/minimax-m3.md) | MiniMax | non précisée | 45,8 % | 73,5 | https://lmcouncil.ai/benchmarks |
| 49 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | Budget | 45,5 % | 73,3 | https://epoch.ai/benchmarks |
| 50 | [o1-preview](https://quelleia.com/modeles/o1-preview.md) | OpenAI | non précisée | 41,7 % | 70,4 | https://epoch.ai/benchmarks |
| 51 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 41,4 % | 70,1 | https://epoch.ai/benchmarks |
| 52 | [Gemini 2.5 Flash (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-flash-jun-2025.md) | Google DeepMind | non précisée | 41,2 % | 70,0 | https://epoch.ai/benchmarks |
| 53 | [DeepSeek-R1 (May 2025)](https://quelleia.com/modeles/deepseek-r1-may-2025.md) | DeepSeek | non précisée | 40,8 % | 69,6 | https://epoch.ai/benchmarks |
| 54 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Élevée | 40,1 % | 69,1 | https://epoch.ai/benchmarks |
| 55 | [DeepSeek-V3.1](https://quelleia.com/modeles/deepseek-v3-1.md) | DeepSeek | non précisée | 40 % | 69,0 | https://epoch.ai/benchmarks |
| 56 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Élevée | 38,7 % | 67,9 | https://epoch.ai/benchmarks |
| 57 | [Grok 3](https://quelleia.com/modeles/grok-3.md) | xAI | non précisée | 36,1 % | 65,5 | https://epoch.ai/benchmarks |
| 58 | [Qwen 3.6 Flash](https://quelleia.com/modeles/qwen-3-6-flash.md) | Alibaba | non précisée | 35,2 % | 64,7 | https://epoch.ai/benchmarks |
| 59 | [GPT-4.5](https://quelleia.com/modeles/gpt-4-5.md) | OpenAI | non précisée | 34,5 % | 64,0 | https://epoch.ai/benchmarks |
| 60 | [Gemini 2.0 Flash (Dec 2024)](https://quelleia.com/modeles/gemini-2-0-flash-dec-2024.md) | Google DeepMind | non précisée | 31,1 % | 60,3 | https://epoch.ai/benchmarks |
| 61 | [Qwen3-235B-A22B](https://quelleia.com/modeles/qwen3-235b-a22b.md) | Alibaba | non précisée | 31 % | 60,2 | https://epoch.ai/benchmarks |
| 62 | [DeepSeek-R1](https://quelleia.com/modeles/deepseek-r1.md) | DeepSeek | non précisée | 30,9 % | 60,1 | https://epoch.ai/benchmarks |
| 63 | [Gemini 2.0 Flash Thinking (Jan 2025)](https://quelleia.com/modeles/gemini-2-0-flash-thinking-jan-2025.md) | Google DeepMind | non précisée | 30,7 % | 59,8 | https://epoch.ai/benchmarks |
| 64 | [Llama 4 Maverick](https://quelleia.com/modeles/llama-4-maverick.md) | Meta AI | non précisée | 27,7 % | 55,9 | https://epoch.ai/benchmarks |
| 65 | [Claude 3.5 Sonnet](https://quelleia.com/modeles/claude-3-5-sonnet.md) | Anthropic | non précisée | 27,5 % | 55,6 | https://epoch.ai/benchmarks |
| 66 | [DeepSeek-V3 (Mar 2025)](https://quelleia.com/modeles/deepseek-v3-mar-2025.md) | DeepSeek | non précisée | 27,2 % | 55,1 | https://epoch.ai/benchmarks |
| 67 | [Gemini 1.5 Pro (Sept 2024)](https://quelleia.com/modeles/gemini-1-5-pro-sept-2024.md) | Google DeepMind | non précisée | 27,1 % | 55,0 | https://epoch.ai/benchmarks |
| 68 | [GPT-4.1](https://quelleia.com/modeles/gpt-4-1.md) | OpenAI | non précisée | 27 % | 54,8 | https://epoch.ai/benchmarks |
| 69 | [Kimi K2 (Jul 2025)](https://quelleia.com/modeles/kimi-k2-jul-2025.md) | Moonshot | non précisée | 26,3 % | 53,7 | https://epoch.ai/benchmarks |
| 70 | [GPT-4 Turbo (Apr 2024)](https://quelleia.com/modeles/gpt-4-turbo-apr-2024.md) | OpenAI | non précisée | 25,1 % | 51,6 | https://epoch.ai/benchmarks |
| 71 | [Claude 3 Opus](https://quelleia.com/modeles/claude-3-opus.md) | Anthropic | non précisée | 23,5 % | 48,4 | https://epoch.ai/benchmarks |
| 72 | [Llama 3.1-405B](https://quelleia.com/modeles/llama-3-1-405b.md) | Meta AI | non précisée | 23 % | 47,2 | https://epoch.ai/benchmarks |
| 73 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 22,8 % | 46,7 | https://epoch.ai/benchmarks |
| 74 | [Grok-2 (Dec 2024)](https://quelleia.com/modeles/grok-2-dec-2024.md) | xAI | non précisée | 22,7 % | 46,5 | https://epoch.ai/benchmarks |
| 75 | [Mistral Large 2 (Jul 2024)](https://quelleia.com/modeles/mistral-large-2-jul-2024.md) | Mistral AI | non précisée | 22,5 % | 46,0 | https://epoch.ai/benchmarks |
| 76 | [gpt-oss-120b](https://quelleia.com/modeles/gpt-oss-120b.md) | OpenAI | non précisée | 22,1 % | 44,9 | https://epoch.ai/benchmarks |
| 77 | [Llama 3.3 70B](https://quelleia.com/modeles/llama-3-3-70b.md) | Meta AI | non précisée | 19,9 % | 37,2 | https://epoch.ai/benchmarks |
| 78 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 18,9 % | 31,9 | https://epoch.ai/benchmarks |
| 79 | [o1-mini](https://quelleia.com/modeles/o1-mini.md) | OpenAI | Moyenne | 18,1 % | 25,5 | https://epoch.ai/benchmarks |
| 80 | [GPT-4o (Aug 2024)](https://quelleia.com/modeles/gpt-4o-aug-2024.md) | OpenAI | non précisée | 17,8 % | 22,2 | https://epoch.ai/benchmarks |
| 81 | [Command R+](https://quelleia.com/modeles/command-r.md) | Cohere | non précisée | 17,4 % | 17,8 | https://epoch.ai/benchmarks |
| 82 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 10,7 % | 17,8 | https://epoch.ai/benchmarks |

## En bref

**Que mesure SimpleBench ?** 213 questions pièges de bon sens, sur l'espace, le temps et les relations sociales, qu'un adulte réussit dans 84 % des cas. Sur Quelle IA, il est rangé dans la tâche Raisonnement.

**Comment SimpleBench est-il noté ?** Part de bonnes réponses à six choix, en moyenne sur cinq passages ; le hasard donne 17 %. Un modèle qui obtient 58 % a un score IA d'environ 82.

**Qui est en tête sur SimpleBench ?** Claude Fable 5 (Anthropic) est en tête de SimpleBench avec 81,9 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5 (80,6 %) et Gemini 3.1 Pro (79,6 %). 82 modèles y sont mesurés.

**Quelles sont les limites de SimpleBench ?** L'essentiel des questions est privé, ce qui limite les fuites mais interdit toute vérification. Les meilleurs modèles rejoignent le niveau humain mesuré. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse SimpleBench dans le score IA ?** SimpleBench compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.

**Qui maintient SimpleBench ?** Équipe SimpleBench (chaîne YouTube AI Explained). Sa page de référence : simple-bench.com.

## Les autres benchmarks de la tâche Raisonnement

- [DTBench](https://quelleia.com/benchmarks/dtbench.md) : 168 modèles · 1,67 % du score, saturé
- [Chess Puzzles](https://quelleia.com/benchmarks/chess_puzzles.md) : 136 modèles · 1,67 % du score
- [LMCA](https://quelleia.com/benchmarks/lmca.md) : 130 modèles · 1,67 % du score
- [ARC-AGI-1](https://quelleia.com/benchmarks/arc_agi.md) : 82 modèles · 1,67 % du score, saturé
- [ARC-AGI-2](https://quelleia.com/benchmarks/arc_agi_2.md) : 80 modèles · 1,67 % du score, saturé
- [ForecastBench](https://quelleia.com/benchmarks/forecastbench.md) : 77 modèles · 1,67 % du score
- [Mystery Game Puzzles](https://quelleia.com/benchmarks/mystery_game_puzzles.md) : 69 modèles · 1,67 % du score
- [EnigmaEval](https://quelleia.com/benchmarks/enigmaeval.md) : 41 modèles · 1,67 % du score
- [LiveBench, raisonnement](https://quelleia.com/benchmarks/livebench_raisonnement.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
