Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

RaisonnementFiche benchmark · Équipe SimpleBench (chaîne YouTube AI Explained) · simple-bench.com

SimpleBench

213 questions pièges de bon sens, sur l'espace, le temps et les relations sociales, qu'un adulte réussit dans 84 % des cas.

À quoi il sert

Sur Quelle IA, SimpleBench sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 82.

Comment c'est noté

Part de bonnes réponses à six choix, en moyenne sur cinq passages ; le hasard donne 17 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 17 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

L'essentiel des questions est privé, ce qui limite les fuites mais interdit toute vérification. Les meilleurs modèles rejoignent le niveau humain mesuré.

Comment lire le score

82 modèles mesurés · 102 mesures

En tête : Claude Fable 5, 81,9 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 58 % a un score IA d'environ 82. Le meilleur, Claude Fable 5, atteint 81,9 %. Le benchmark sera dit saturé quand un modèle atteindra 95,8 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
25 %
Score IA 76niveau de Claude Sonnet 4.5
50 %
Score IA 100niveau de Claude Opus 5.5
82 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. SimpleBench porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.

En couleur, la tâche Raisonnement dans le score général. En noir, la part de SimpleBench.

Le classement du benchmark

Scores relevés auprès de 2 sources · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Fable 5AnthropicMaximale81,9 %100,2
2Claude Opus 5AnthropicNon précisée80,6 %98,9
3Gemini 3.1 ProGoogle DeepMindNon précisée79,6 %98,0
4GPT-5.5 ProOpenAI · 2 configurationsNon précisée76,9 %95,6
5Gemini 3.5 FlashGoogle DeepMindNon précisée76,7 %95,5
6Gemini 3 ProGoogle DeepMindNon précisée76,4 %95,2
7Grok 4.6xAINon précisée75,9 %94,8
8Muse Spark 1.2Meta AINon précisée74,5 %93,7
9GPT-5.4 ProOpenAINon précisée74,1 %93,4
10GPT-5.6 SolOpenAI · 4 configurationsNon précisée71,7 %91,5
82 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 82 →Replier le classement ↑
11Qwen3.7-MaxAlibabaNon précisée70,4 %90,6
12Grok 4.5xAINon précisée70 %90,3
13GPT-5.5OpenAINon précisée69 %89,5
14Claude Opus 4.6AnthropicNon précisée67,6 %88,5
15Claude Opus 4.8AnthropicNon précisée64,8 %86,6
16Qwen 3.6 Max (Preview)AlibabaNon précisée63 %85,4
17Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée62,4 %85,0
18Claude Opus 4.5Anthropic · 2 configurationsNon précisée62 %84,7
19Claude Opus 4.7AnthropicNon précisée61,7 %84,5
20GPT-5 ProOpenAI · 2 configurationsÉlevée61,6 %84,4
21DeepSeek V4 Flash 0731DeepSeek · poids ouvertsNon précisée61,1 %84,1
21Gemini 3 FlashGoogle DeepMindNon précisée61,1 %84,1
23Kimi K3Moonshot · poids ouvertsMaximale60,7 %83,8
24Claude Sonnet 5AnthropicNon précisée60,6 %83,7
25Grok 4xAINon précisée60,5 %83,7
26Claude Opus 4.1Anthropic · 2 configurationsNon précisée60 %83,3
27GLM-5.2Z.ai (Zhipu AI) · poids ouvertsNon précisée58,8 %82,5
27Claude Opus 4Anthropic · 2 configurationsBudget58,8 %82,5
29Kimi K2.7 CodeMoonshot · poids ouvertsNon précisée57,9 %81,9
30GPT-5.2 ProOpenAINon précisée57,4 %81,6
31GPT-5OpenAIÉlevée56,7 %81,1
32Grok 4.1 FastxAI · 2 configurationsNon précisée56 %80,6
33GLM-5.1Z.ai (Zhipu AI) · poids ouvertsNon précisée55,1 %80,0
34Claude Sonnet 4.5Anthropic · 2 configurationsNon précisée54,3 %79,5
35GPT-5.1OpenAIÉlevée53,2 %78,7
35GLM-5Z.ai (Zhipu AI) · poids ouvertsNon précisée53,2 %78,7
37o3OpenAIÉlevée53,1 %78,7
38DeepSeek-V3.2-SpecialeDeepSeek · poids ouvertsNon précisée52,6 %78,3
39Gemini 2.5 Pro (Mar 2025)Google DeepMind · 2 configurationsNon précisée51,6 %77,6
40InklingThinking Machines · poids ouvertsNon précisée50 %76,5
41GPT-5.6 TerraOpenAI · 2 configurationsMaximale48,9 %75,8
42GLM-4.7Z.ai (Zhipu AI) · poids ouverts · 2 configurationsNon précisée47,7 %74,9
43GPT-5.6 LunaOpenAI · 2 configurationsNon précisée46,8 %74,2
44Kimi K2.5Moonshot · poids ouvertsNon précisée46,8 %74,2
45Claude 3.7 SonnetAnthropic · 3 configurationsBudget46,4 %74,0
46DeepSeek-V4-FlashDeepSeek · poids ouvertsNon précisée46,3 %73,9
47GPT-5.2OpenAI · 2 configurationsÉlevée45,8 %73,5
48MiniMax-M3MiniMax · poids ouvertsNon précisée45,8 %73,5
49Claude Sonnet 4Anthropic · 2 configurationsBudget45,5 %73,3
50o1-previewOpenAINon précisée41,7 %70,4
51Claude 3.5 Sonnet (October 2024)AnthropicNon précisée41,4 %70,1
52Gemini 2.5 Flash (Jun 2025)Google DeepMindNon précisée41,2 %70,0
53DeepSeek-R1 (May 2025)DeepSeek · poids ouvertsNon précisée40,8 %69,6
54o1OpenAI · 2 configurationsÉlevée40,1 %69,1
55DeepSeek-V3.1DeepSeek · poids ouvertsNon précisée40 %69,0
56o4-miniOpenAIÉlevée38,7 %67,9
57Grok 3xAINon précisée36,1 %65,5
58Qwen 3.6 FlashAlibabaNon précisée35,2 %64,7
59GPT-4.5OpenAINon précisée34,5 %64,0
60Gemini 2.0 Flash (Dec 2024)Google DeepMind · 2 configurationsNon précisée31,1 %60,3
61Qwen3-235B-A22BAlibaba · poids ouvertsNon précisée31 %60,2
62DeepSeek-R1DeepSeek · poids ouvertsNon précisée30,9 %60,1
63Gemini 2.0 Flash Thinking (Jan 2025)Google DeepMindNon précisée30,7 %59,8
64Llama 4 MaverickMeta AI · poids ouvertsNon précisée27,7 %55,9
65Claude 3.5 SonnetAnthropicNon précisée27,5 %55,6
66DeepSeek-V3 (Mar 2025)DeepSeek · poids ouvertsNon précisée27,2 %55,1
67Gemini 1.5 Pro (Sept 2024)Google DeepMindNon précisée27,1 %55,0
68GPT-4.1OpenAINon précisée27 %54,8
69Kimi K2 (Jul 2025)MoonshotNon précisée26,3 %53,7
70GPT-4 Turbo (Apr 2024)OpenAINon précisée25,1 %51,6
71Claude 3 OpusAnthropicNon précisée23,5 %48,4
72Llama 3.1-405BMeta AI · poids ouvertsNon précisée23 %47,2
73o3-miniOpenAIÉlevée22,8 %46,7
74Grok-2 (Dec 2024)xAINon précisée22,7 %46,5
75Mistral Large 2 (Jul 2024)Mistral AINon précisée22,5 %46,0
76gpt-oss-120bOpenAI · poids ouvertsNon précisée22,1 %44,9
77Llama 3.3 70BMeta AI · poids ouvertsNon précisée19,9 %37,2
78DeepSeek-V3DeepSeek · poids ouvertsNon précisée18,9 %31,9
79o1-miniOpenAIMoyenne18,1 %25,5
80GPT-4o (Aug 2024)OpenAINon précisée17,8 %22,2
81Command R+Cohere · poids ouvertsNon précisée17,4 %17,8
82GPT-4o miniOpenAINon précisée10,7 %17,8

En bref

Que mesure SimpleBench ?
213 questions pièges de bon sens, sur l'espace, le temps et les relations sociales, qu'un adulte réussit dans 84 % des cas. Sur Quelle IA, il est rangé dans la tâche Raisonnement.
Comment SimpleBench est-il noté ?
Part de bonnes réponses à six choix, en moyenne sur cinq passages ; le hasard donne 17 %. Un modèle qui obtient 58 % a un score IA d'environ 82.
Qui est en tête sur SimpleBench ?
Claude Fable 5 (Anthropic) est en tête de SimpleBench avec 81,9 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5 (80,6 %) et Gemini 3.1 Pro (79,6 %). 82 modèles y sont mesurés.
Quelles sont les limites de SimpleBench ?
L'essentiel des questions est privé, ce qui limite les fuites mais interdit toute vérification. Les meilleurs modèles rejoignent le niveau humain mesuré. Au 28 septembre 2026, le benchmark est actif.
Combien pèse SimpleBench dans le score IA ?
SimpleBench compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks.
Qui maintient SimpleBench ?
Équipe SimpleBench (chaîne YouTube AI Explained). Sa page de référence : simple-bench.com.

Les autres benchmarks de la tâche Raisonnement

Tous les benchmarks →Comment le score IA est calculé →