Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

RaisonnementFiche benchmark · Redwood Research · conceptualreasoning.ai

DTBench

407 questions de théorie de la décision sur des dilemmes de type Newcomb, où le choix d'un agent renseigne sur celui de ses semblables.

SATURÉ

À quoi il sert

Sur Quelle IA, DTBench sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 62.

Comment c'est noté

Part de bonnes réponses ; le hasard donne 40 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 40 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Domaine très étroit, et les meilleurs modèles frôlent 99 %. Les questions d'opinion du jeu sont exclues du score.

Comment lire le score

168 modèles mesurés · 211 mesures

En tête : Claude Opus 5.5, 98,9 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 70 % a un score IA d'environ 62. Le meilleur, Claude Opus 5.5, atteint 98,9 %. Le seuil de saturation (97 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
59 %
Score IA 76niveau de Claude Sonnet 4.5
84 %
Score IA 100niveau de Claude Opus 5.5
96 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. DTBench porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

En couleur, la tâche Raisonnement dans le score général. En noir, la part de DTBench.

Le classement du benchmark

Scores relevés sur conceptualreasoning.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Opus 5.5AnthropicMaximale98,9 %118,9
2Claude Fable 5Anthropic · 5 configurationsMaximale98,4 %113,1
3Claude Opus 5Anthropic · 5 configurationsMaximale97,9 %108,9
4Claude Fable 5.1Anthropic · 5 configurationsNon précisée97,6 %107,2
5GPT-6 AstraOpenAI · 5 configurationsMaximale97,3 %105,6
5Grok 4.6xAIMaximale97,3 %105,6
7Gemini 3.1 ProGoogle DeepMind · 3 configurationsMoyenne97,1 %104,2
8Gemini 3.7 FlashGoogle DeepMind · 3 configurationsÉlevée96,8 %102,9
9Muse Spark 1.3Meta AINon précisée96,5 %101,7
9Grok 4.5xAIÉlevée96,5 %101,7
168 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 168 →Replier le classement ↑
11GPT-5.5 ProOpenAIMaximale96 %99,5
11GPT-5.6 SolOpenAI · 7 configurationsMaximale96 %99,5
11GPT-5.5OpenAIMaximale96 %99,5
14Gemini 3.8 FlashGoogle DeepMind · 3 configurationsNon précisée95,7 %98,5
15Gemini 3.6 FlashGoogle DeepMindÉlevée95,5 %97,6
16Claude Opus 4.8AnthropicMaximale94,9 %95,9
17Muse Spark 1.2Meta AIMaximale94,7 %95,1
17Gemini 3.5 FlashGoogle DeepMindÉlevée94,7 %95,1
19Claude Opus 4.7AnthropicMaximale94,7 %95,1
20GPT-5.4OpenAIMaximale94,4 %94,4
20Muse Spark 1.1Meta AIÉlevée94,4 %94,4
22DeepSeek V4 Pro 0813DeepSeek · poids ouvertsNon précisée93,9 %92,9
23GLM-5.2Z.ai (Zhipu AI) · poids ouvertsMaximale93,6 %92,2
24GPT-5.6 TerraOpenAI · 6 configurationsMaximale93,3 %91,6
25Claude Sonnet 5Anthropic · 5 configurationsMaximale92,5 %89,7
26Qwen3.7-MaxAlibabaNon précisée92,3 %89,2
27Qwen 3.8 MaxAlibabaMaximale92 %88,7
28Kimi K3Moonshot · poids ouvertsMaximale91,2 %87,1
28Claude Opus 4.6AnthropicMaximale91,2 %87,1
30DeepSeek V4 Flash 0731DeepSeek · poids ouvertsMaximale90,9 %86,6
30GPT-5.2OpenAIMaximale90,9 %86,6
30Kimi K2.6Moonshot · poids ouvertsNon précisée90,9 %86,6
33DeepSeek-V4-ProDeepSeek · poids ouvertsMaximale90,7 %86,1
33GPT-5OpenAIÉlevée90,7 %86,1
33Grok 4.3 BetaxAIÉlevée90,7 %86,1
36Grok 4.20xAINon précisée90,1 %85,2
36GPT-5.1OpenAIÉlevée90,1 %85,2
36Nemotron 3 UltraNVIDIA · poids ouvertsNon précisée90,1 %85,2
39DeepSeek V4.1 FlashDeepSeek · poids ouvertsNon précisée89,9 %84,7
39Claude Sonnet 4.6AnthropicMaximale89,9 %84,7
39Claude Opus 4.5AnthropicÉlevée89,9 %84,7
42GPT-5.6 LunaOpenAI · 6 configurationsMaximale89,1 %83,4
42Gemini 3 FlashGoogle DeepMindÉlevée89,1 %83,4
44Qwen 3.8 27BAlibaba · poids ouvertsNon précisée88 %81,8
45Grok 4.1 FastxAINon précisée87,7 %81,4
45DeepSeek-V3.2-ExpDeepSeekÉlevée87,7 %81,4
47GLM-5.3Z.ai (Zhipu AI) · poids ouvertsNon précisée87,7 %81,3
48InklingThinking Machines · poids ouvertsMaximale87,5 %81,0
48Qwen3.5 397B-A17BAlibaba · poids ouvertsNon précisée87,5 %81,0
50Qwen 3.6 Max (Preview)AlibabaNon précisée87,2 %80,6
51o3-proOpenAIÉlevée86,9 %80,2
52DeepSeek-V4-FlashDeepSeek · poids ouvertsMaximale86,4 %79,5
53DeepSeek-V3.2DeepSeek · poids ouverts · 2 configurationsNon précisée85,6 %78,5
54o3OpenAIÉlevée84,8 %77,5
55MiMo-V2.5-ProXiaomi · poids ouvertsNon précisée84,5 %77,1
56Qwen3.5-122B-A10BAlibaba · poids ouvertsSans84,3 %76,8
57Qwen3.7-PlusAlibabaNon précisée84 %76,5
58Gemini 3.5 Flash-LiteGoogle DeepMindÉlevée83,5 %75,8
59Claude Sonnet 4.5AnthropicNon précisée83,2 %75,5
60Qwen 3.5 Flash (hosted 35B-A3B)AlibabaNon précisée82,9 %75,2
61Gemma 4 31B ITGoogle DeepMind · poids ouvertsNon précisée82,7 %74,9
61DeepSeek-V3.1DeepSeek · poids ouvertsÉlevée82,7 %74,9
61Grok 4 FastxAINon précisée82,7 %74,9
64Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée82,4 %74,6
64Qwen3.5-27BAlibaba · poids ouvertsNon précisée82,4 %74,6
66Qwen3-MaxAlibabaNon précisée82,1 %74,3
67Qwen 3.6 PlusAlibabaNon précisée81,9 %74,0
68Claude Opus 4AnthropicNon précisée81,6 %73,7
69DeepSeek-V3.1-TerminusDeepSeek · poids ouvertsNon précisée81,3 %73,4
70Qwen Plus (Apr 2025)AlibabaNon précisée81,1 %73,1
71Qwen 3.5 Plus (hosted 397B-A17B)AlibabaNon précisée80,5 %72,5
71GPT-5 miniOpenAIÉlevée80,5 %72,5
73GPT-5.4 NanoOpenAIMaximale80,3 %72,2
73Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée80,3 %72,2
75GPT-5.4 MiniOpenAIMaximale80 %72,0
75Claude Opus 4.1AnthropicNon précisée80 %72,0
75Qwen3.5-35B-A3BAlibaba · poids ouvertsNon précisée80 %72,0
78MiniMax-M3MiniMax · poids ouvertsNon précisée78,9 %70,8
79Qwen3-235B-A22B-Instruct (Jul 2025)Alibaba · poids ouvertsNon précisée78,4 %70,3
80Qwen3.6 27BAlibaba · poids ouvertsNon précisée78,1 %70,0
81o4-miniOpenAIÉlevée77,6 %69,5
82Qwen 3.6 FlashAlibabaNon précisée77,1 %68,9
82Claude Sonnet 4AnthropicNon précisée77,1 %68,9
84Gemini 3.1 Flash-LiteGoogle DeepMindÉlevée76,8 %68,7
85Gemini 2.5 Flash (Jun 2025)Google DeepMindNon précisée76,5 %68,4
86gpt-oss-120bOpenAI · poids ouvertsÉlevée76,3 %68,1
87Qwen3-235B-A22BAlibaba · poids ouvertsNon précisée75,7 %67,6
88Mistral Medium 3.5Mistral AI · poids ouvertsNon précisée75,5 %67,4
89Gemma 4 26B A4BGoogle DeepMind · poids ouvertsNon précisée74,9 %66,8
90o1OpenAIÉlevée74,7 %66,6
91Qwen 3.6 35B-A3BAlibaba · poids ouvertsNon précisée73,9 %65,8
92Claude Haiku 4.5AnthropicNon précisée73,6 %65,6
93Qwen3.5-9BAlibaba · poids ouvertsNon précisée71,2 %63,3
94Mistral Small 4Mistral AI · poids ouvertsNon précisée70,9 %63,0
95Qwen3-30B-A3B-Thinking (Jul 2025)Alibaba · poids ouvertsNon précisée69,3 %61,5
96o3-miniOpenAIÉlevée68,8 %61,0
96GPT-4.1 miniOpenAINon précisée68,8 %61,0
98GPT-4.1OpenAINon précisée68,3 %60,5
99gpt-oss-20bOpenAI · poids ouvertsÉlevée68 %60,2
100Claude 3.5 Sonnet (October 2024)AnthropicNon précisée67,8 %60,1
101Claude 3.5 SonnetAnthropicNon précisée67,8 %60,0
102Mistral Medium 3.1Mistral AINon précisée67,5 %59,7
102Qwen3-32BAlibaba · poids ouvertsNon précisée67,5 %59,7
104Qwen3-30B-A3B-Instruct (Jul 2025)Alibaba · poids ouvertsNon précisée67,2 %59,5
105Grok-2 (Dec 2024)xAINon précisée65,2 %57,6
106Mistral Large 3Mistral AI · poids ouvertsNon précisée65,1 %57,4
107DeepSeek-V3 (Mar 2025)DeepSeek · poids ouvertsNon précisée64,8 %57,2
108GPT-4o (May 2024)OpenAINon précisée64,5 %56,9
109Qwen3-14BAlibaba · poids ouvertsNon précisée64 %56,4
110Gemini 2.0 Flash (Feb 2025)Google DeepMindNon précisée63,2 %55,6
111Qwen2.5-72BAlibaba · poids ouvertsNon précisée62,9 %55,3
112Gemini 2.5 Flash-Lite (Jun 2025)Google DeepMindNon précisée62,8 %55,2
113GPT-5 nanoOpenAIÉlevée62,7 %55,1
113GPT-4 (Jun 2023)OpenAINon précisée62,7 %55,1
115Mistral Medium 3Mistral AINon précisée62,3 %54,7
116Llama 4 MaverickMeta AI · poids ouvertsNon précisée61,9 %54,3
117Claude 3 OpusAnthropicNon précisée61,6 %54,0
117GPT-4 Turbo (Nov 2023)OpenAINon précisée61,6 %54,0
119Llama 3.1-405BMeta AI · poids ouvertsNon précisée61,4 %53,8
120Cohere Command ACohere · poids ouvertsNon précisée61,3 %53,7
121Magistral Small 1.2Mistral AI · poids ouvertsNon précisée61,3 %53,7
122Mistral Large 2 (Jul 2024)Mistral AINon précisée61,2 %53,6
123Mistral Large 2 (Nov 2024)Mistral AI · poids ouvertsNon précisée60,8 %53,2
124Qwen3-30B-A3BAlibaba · poids ouvertsNon précisée60,3 %52,6
125Llama 3.1-70BMeta AI · poids ouvertsNon précisée60 %52,3
126Mistral Small 3.2Mistral AI · poids ouvertsNon précisée59,9 %52,2
127Qwen3-8BAlibaba · poids ouvertsNon précisée59,7 %52,0
128Llama 3.3 70BMeta AI · poids ouvertsNon précisée59,5 %51,7
129Gemini 1.5 Pro (Sept 2024)Google DeepMindNon précisée59 %51,2
130Mistral Small 3.1Mistral AINon précisée58,6 %50,8
131Llama 4 ScoutMeta AI · poids ouvertsNon précisée57,9 %50,0
132Claude 3.5 HaikuAnthropicNon précisée56,7 %48,6
133Gemini 1.5 Pro (May 2024)Google DeepMindNon précisée56,5 %48,4
134Mistral LargeMistral AI · poids ouvertsNon précisée55,9 %47,7
135Mixtral 8x22BMistral AI · poids ouvertsNon précisée55,1 %46,7
136Command R+Cohere · poids ouvertsNon précisée54,9 %46,5
137GPT-4o miniOpenAINon précisée54,4 %45,8
138Llama 3-70BMeta AI · poids ouvertsNon précisée54,2 %45,5
139Gemini 1.5 Flash (Sep 2024)Google DeepMindNon précisée53,8 %45,0
140Claude 3 SonnetAnthropicNon précisée53,6 %44,7
141Mistral MediumMistral AI · poids ouvertsNon précisée53,3 %44,3
142mistral-small-2402Mistral AI · poids ouvertsNon précisée53 %43,9
143Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée52,5 %43,3
143Gemini 2.0 Flash-LiteGoogle DeepMindNon précisée52,5 %43,3
143GPT-4.1 nanoOpenAINon précisée52,5 %43,3
146Claude 2AnthropicNon précisée51,9 %42,3
147Ministral 3BMistral AI · poids ouvertsNon précisée51,7 %42,1
148Gemini 1.5 Flash (May 2024)Google DeepMindNon précisée51,4 %41,6
149Claude 2.1AnthropicNon précisée51 %40,9
150Gemma 3 4BGoogle DeepMind · poids ouvertsNon précisée50,9 %40,9
150Llama 3.1-8BMeta AI · poids ouvertsNon précisée50,9 %40,9
152Claude 3 HaikuAnthropicNon précisée50,1 %39,5
153Gemini 1.5 Flash 8BGoogle DeepMindNon précisée50 %39,4
154Mixtral 8x7BMistral AI · poids ouvertsNon précisée49,6 %38,7
155Mistral Small v24.09Mistral AI · poids ouvertsNon précisée49,5 %38,5
156Gemma 3 12BGoogle DeepMind · poids ouvertsNon précisée48,8 %37,2
157Mistral NeMoMistral AI · poids ouvertsNon précisée48,6 %36,8
158GPT-3.5 Turbo (Jan 2024)OpenAINon précisée48,5 %36,7
159Gemma 2 27BGoogle DeepMindNon précisée48 %35,6
160Qwen2.5-7BAlibaba · poids ouvertsNon précisée47,7 %35,0
161c4ai-command-r-08-2024Cohere · poids ouvertsNon précisée46,4 %32,0
162Gemini 1.0 ProGoogle DeepMindNon précisée45,9 %30,6
163Claude InstantAnthropicNon précisée45,8 %30,4
164Ministral 8BMistral AI · poids ouvertsNon précisée45,7 %30,2
165Llama 3-8BMeta AI · poids ouvertsNon précisée43,9 %24,5
166Mistral 7B v0.3Mistral AI · poids ouvertsNon précisée42,5 %17,9
167Llama 2-13BMeta AI · poids ouvertsNon précisée42,2 %16,1
168Llama 2-70BMeta AI · poids ouvertsNon précisée41,7 %11,6

En bref

Que mesure DTBench ?
407 questions de théorie de la décision sur des dilemmes de type Newcomb, où le choix d'un agent renseigne sur celui de ses semblables. Sur Quelle IA, il est rangé dans la tâche Raisonnement.
Comment DTBench est-il noté ?
Part de bonnes réponses ; le hasard donne 40 %. Un modèle qui obtient 70 % a un score IA d'environ 62.
Qui est en tête sur DTBench ?
Claude Opus 5.5 (Anthropic) est en tête de DTBench avec 98,9 %, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5 (98,4 %) et Claude Opus 5 (97,9 %). 168 modèles y sont mesurés.
Quelles sont les limites de DTBench ?
Domaine très étroit, et les meilleurs modèles frôlent 99 %. Les questions d'opinion du jeu sont exclues du score. Au 28 septembre 2026, le benchmark est saturé.
Combien pèse DTBench dans le score IA ?
DTBench compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.
Qui maintient DTBench ?
Redwood Research. Sa page de référence : conceptualreasoning.ai/dtbench.

Les autres benchmarks de la tâche Raisonnement

Tous les benchmarks →Comment le score IA est calculé →