# DTBench

> Fiche du benchmark DTBench sur Quelle IA, édition du 28 septembre 2026. 407 questions de théorie de la décision sur des dilemmes de type Newcomb, où le choix d'un agent renseigne sur celui de ses semblables. En tête au 28 septembre 2026 : Claude Opus 5.5 (98,9 %). Notation, limites et classement des 168 modèles mesurés.

Page : https://quelleia.com/benchmarks/dtbench/
Source du benchmark : https://conceptualreasoning.ai/dtbench
Mainteneur : Redwood Research
Tâche : Raisonnement
État : saturé

## À quoi il sert

Sur Quelle IA, DTBench sert à noter la tâche Raisonnement : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 62.

## Comment c'est noté

Part de bonnes réponses ; le hasard donne 40 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 40 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Domaine très étroit, et les meilleurs modèles frôlent 99 %. Les questions d'opinion du jeu sont exclues du score.

## Qui le tient

Redwood Research.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 70 % a un score IA d'environ 62. Le meilleur, Claude Opus 5.5, atteint 98,9 %. Le seuil de saturation (97 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 59 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 84 %
- Score IA 100 (niveau de Claude Opus 5.5) : 96 %

## Son poids dans le score IA

1,67 % du score général. DTBench porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

## Classement (168 modèles mesurés · 211 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Opus 5.5](https://quelleia.com/modeles/claude-opus-5-5.md) | Anthropic | Maximale | 98,9 % | 118,9 | https://conceptualreasoning.ai/dtbench |
| 2 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Maximale | 98,4 % | 113,1 | https://conceptualreasoning.ai/dtbench |
| 3 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 97,9 % | 108,9 | https://conceptualreasoning.ai/dtbench |
| 4 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | non précisée | 97,6 % | 107,2 | https://conceptualreasoning.ai/dtbench |
| 5 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | Maximale | 97,3 % | 105,6 | https://conceptualreasoning.ai/dtbench |
| 5 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | Maximale | 97,3 % | 105,6 | https://conceptualreasoning.ai/dtbench |
| 7 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | Moyenne | 97,1 % | 104,2 | https://conceptualreasoning.ai/dtbench |
| 8 | [Gemini 3.7 Flash](https://quelleia.com/modeles/gemini-3-7-flash.md) | Google DeepMind | Élevée | 96,8 % | 102,9 | https://conceptualreasoning.ai/dtbench |
| 9 | [Muse Spark 1.3](https://quelleia.com/modeles/muse-spark-1-3.md) | Meta AI | non précisée | 96,5 % | 101,7 | https://conceptualreasoning.ai/dtbench |
| 9 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | Élevée | 96,5 % | 101,7 | https://conceptualreasoning.ai/dtbench |
| 11 | [GPT-5.5 Pro](https://quelleia.com/modeles/gpt-5-5-pro.md) | OpenAI | Maximale | 96 % | 99,5 | https://conceptualreasoning.ai/dtbench |
| 11 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 96 % | 99,5 | https://conceptualreasoning.ai/dtbench |
| 11 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 96 % | 99,5 | https://conceptualreasoning.ai/dtbench |
| 14 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | non précisée | 95,7 % | 98,5 | https://conceptualreasoning.ai/dtbench |
| 15 | [Gemini 3.6 Flash](https://quelleia.com/modeles/gemini-3-6-flash.md) | Google DeepMind | Élevée | 95,5 % | 97,6 | https://conceptualreasoning.ai/dtbench |
| 16 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 94,9 % | 95,9 | https://conceptualreasoning.ai/dtbench |
| 17 | [Muse Spark 1.2](https://quelleia.com/modeles/muse-spark-1-2.md) | Meta AI | Maximale | 94,7 % | 95,1 | https://conceptualreasoning.ai/dtbench |
| 17 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | Élevée | 94,7 % | 95,1 | https://conceptualreasoning.ai/dtbench |
| 19 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Maximale | 94,7 % | 95,1 | https://conceptualreasoning.ai/dtbench |
| 20 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 94,4 % | 94,4 | https://conceptualreasoning.ai/dtbench |
| 20 | [Muse Spark 1.1](https://quelleia.com/modeles/muse-spark-1-1.md) | Meta AI | Élevée | 94,4 % | 94,4 | https://conceptualreasoning.ai/dtbench |
| 22 | [DeepSeek V4 Pro 0813](https://quelleia.com/modeles/deepseek-v4-pro-0813.md) | DeepSeek | non précisée | 93,9 % | 92,9 | https://conceptualreasoning.ai/dtbench |
| 23 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | Maximale | 93,6 % | 92,2 | https://conceptualreasoning.ai/dtbench |
| 24 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 93,3 % | 91,6 | https://conceptualreasoning.ai/dtbench |
| 25 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | Maximale | 92,5 % | 89,7 | https://conceptualreasoning.ai/dtbench |
| 26 | [Qwen3.7-Max](https://quelleia.com/modeles/qwen3-7-max.md) | Alibaba | non précisée | 92,3 % | 89,2 | https://conceptualreasoning.ai/dtbench |
| 27 | [Qwen 3.8 Max](https://quelleia.com/modeles/qwen-3-8-max.md) | Alibaba | Maximale | 92 % | 88,7 | https://conceptualreasoning.ai/dtbench |
| 28 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | Maximale | 91,2 % | 87,1 | https://conceptualreasoning.ai/dtbench |
| 28 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Maximale | 91,2 % | 87,1 | https://conceptualreasoning.ai/dtbench |
| 30 | [DeepSeek V4 Flash 0731](https://quelleia.com/modeles/deepseek-v4-flash-0731.md) | DeepSeek | Maximale | 90,9 % | 86,6 | https://conceptualreasoning.ai/dtbench |
| 30 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Maximale | 90,9 % | 86,6 | https://conceptualreasoning.ai/dtbench |
| 30 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 90,9 % | 86,6 | https://conceptualreasoning.ai/dtbench |
| 33 | [DeepSeek-V4-Pro](https://quelleia.com/modeles/deepseek-v4-pro.md) | DeepSeek | Maximale | 90,7 % | 86,1 | https://conceptualreasoning.ai/dtbench |
| 33 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 90,7 % | 86,1 | https://conceptualreasoning.ai/dtbench |
| 33 | [Grok 4.3 Beta](https://quelleia.com/modeles/grok-4-3-beta.md) | xAI | Élevée | 90,7 % | 86,1 | https://conceptualreasoning.ai/dtbench |
| 36 | [Grok 4.20](https://quelleia.com/modeles/grok-4-20.md) | xAI | non précisée | 90,1 % | 85,2 | https://conceptualreasoning.ai/dtbench |
| 36 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Élevée | 90,1 % | 85,2 | https://conceptualreasoning.ai/dtbench |
| 36 | [Nemotron 3 Ultra](https://quelleia.com/modeles/nemotron-3-ultra.md) | NVIDIA | non précisée | 90,1 % | 85,2 | https://conceptualreasoning.ai/dtbench |
| 39 | [DeepSeek V4.1 Flash](https://quelleia.com/modeles/deepseek-v4-1-flash.md) | DeepSeek | non précisée | 89,9 % | 84,7 | https://conceptualreasoning.ai/dtbench |
| 39 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | Maximale | 89,9 % | 84,7 | https://conceptualreasoning.ai/dtbench |
| 39 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | Élevée | 89,9 % | 84,7 | https://conceptualreasoning.ai/dtbench |
| 42 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | Maximale | 89,1 % | 83,4 | https://conceptualreasoning.ai/dtbench |
| 42 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | Élevée | 89,1 % | 83,4 | https://conceptualreasoning.ai/dtbench |
| 44 | [Qwen 3.8 27B](https://quelleia.com/modeles/qwen-3-8-27b.md) | Alibaba | non précisée | 88 % | 81,8 | https://conceptualreasoning.ai/dtbench |
| 45 | [Grok 4.1 Fast](https://quelleia.com/modeles/grok-4-1-fast.md) | xAI | non précisée | 87,7 % | 81,4 | https://conceptualreasoning.ai/dtbench |
| 45 | [DeepSeek-V3.2-Exp](https://quelleia.com/modeles/deepseek-v3-2-exp.md) | DeepSeek | Élevée | 87,7 % | 81,4 | https://conceptualreasoning.ai/dtbench |
| 47 | [GLM-5.3](https://quelleia.com/modeles/glm-5-3.md) | Z.ai (Zhipu AI) | non précisée | 87,7 % | 81,3 | https://conceptualreasoning.ai/dtbench |
| 48 | [Inkling](https://quelleia.com/modeles/inkling.md) | Thinking Machines | Maximale | 87,5 % | 81,0 | https://conceptualreasoning.ai/dtbench |
| 48 | [Qwen3.5 397B-A17B](https://quelleia.com/modeles/qwen3-5-397b-a17b.md) | Alibaba | non précisée | 87,5 % | 81,0 | https://conceptualreasoning.ai/dtbench |
| 50 | [Qwen 3.6 Max (Preview)](https://quelleia.com/modeles/qwen-3-6-max-preview.md) | Alibaba | non précisée | 87,2 % | 80,6 | https://conceptualreasoning.ai/dtbench |
| 51 | [o3-pro](https://quelleia.com/modeles/o3-pro.md) | OpenAI | Élevée | 86,9 % | 80,2 | https://conceptualreasoning.ai/dtbench |
| 52 | [DeepSeek-V4-Flash](https://quelleia.com/modeles/deepseek-v4-flash.md) | DeepSeek | Maximale | 86,4 % | 79,5 | https://conceptualreasoning.ai/dtbench |
| 53 | [DeepSeek-V3.2](https://quelleia.com/modeles/deepseek-v3-2.md) | DeepSeek | non précisée | 85,6 % | 78,5 | https://conceptualreasoning.ai/dtbench |
| 54 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Élevée | 84,8 % | 77,5 | https://conceptualreasoning.ai/dtbench |
| 55 | [MiMo-V2.5-Pro](https://quelleia.com/modeles/mimo-v2-5-pro.md) | Xiaomi | non précisée | 84,5 % | 77,1 | https://conceptualreasoning.ai/dtbench |
| 56 | [Qwen3.5-122B-A10B](https://quelleia.com/modeles/qwen3-5-122b-a10b.md) | Alibaba | Sans | 84,3 % | 76,8 | https://conceptualreasoning.ai/dtbench |
| 57 | [Qwen3.7-Plus](https://quelleia.com/modeles/qwen3-7-plus.md) | Alibaba | non précisée | 84 % | 76,5 | https://conceptualreasoning.ai/dtbench |
| 58 | [Gemini 3.5 Flash-Lite](https://quelleia.com/modeles/gemini-3-5-flash-lite.md) | Google DeepMind | Élevée | 83,5 % | 75,8 | https://conceptualreasoning.ai/dtbench |
| 59 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | non précisée | 83,2 % | 75,5 | https://conceptualreasoning.ai/dtbench |
| 60 | [Qwen 3.5 Flash (hosted 35B-A3B)](https://quelleia.com/modeles/qwen-3-5-flash-hosted-35b-a3b.md) | Alibaba | non précisée | 82,9 % | 75,2 | https://conceptualreasoning.ai/dtbench |
| 61 | [Gemma 4 31B IT](https://quelleia.com/modeles/gemma-4-31b-it.md) | Google DeepMind | non précisée | 82,7 % | 74,9 | https://conceptualreasoning.ai/dtbench |
| 61 | [DeepSeek-V3.1](https://quelleia.com/modeles/deepseek-v3-1.md) | DeepSeek | Élevée | 82,7 % | 74,9 | https://conceptualreasoning.ai/dtbench |
| 61 | [Grok 4 Fast](https://quelleia.com/modeles/grok-4-fast.md) | xAI | non précisée | 82,7 % | 74,9 | https://conceptualreasoning.ai/dtbench |
| 64 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 82,4 % | 74,6 | https://conceptualreasoning.ai/dtbench |
| 64 | [Qwen3.5-27B](https://quelleia.com/modeles/qwen3-5-27b.md) | Alibaba | non précisée | 82,4 % | 74,6 | https://conceptualreasoning.ai/dtbench |
| 66 | [Qwen3-Max](https://quelleia.com/modeles/qwen3-max.md) | Alibaba | non précisée | 82,1 % | 74,3 | https://conceptualreasoning.ai/dtbench |
| 67 | [Qwen 3.6 Plus](https://quelleia.com/modeles/qwen-3-6-plus.md) | Alibaba | non précisée | 81,9 % | 74,0 | https://conceptualreasoning.ai/dtbench |
| 68 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | non précisée | 81,6 % | 73,7 | https://conceptualreasoning.ai/dtbench |
| 69 | [DeepSeek-V3.1-Terminus](https://quelleia.com/modeles/deepseek-v3-1-terminus.md) | DeepSeek | non précisée | 81,3 % | 73,4 | https://conceptualreasoning.ai/dtbench |
| 70 | [Qwen Plus (Apr 2025)](https://quelleia.com/modeles/qwen-plus-apr-2025.md) | Alibaba | non précisée | 81,1 % | 73,1 | https://conceptualreasoning.ai/dtbench |
| 71 | [Qwen 3.5 Plus (hosted 397B-A17B)](https://quelleia.com/modeles/qwen-3-5-plus-hosted-397b-a17b.md) | Alibaba | non précisée | 80,5 % | 72,5 | https://conceptualreasoning.ai/dtbench |
| 71 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | Élevée | 80,5 % | 72,5 | https://conceptualreasoning.ai/dtbench |
| 73 | [GPT-5.4 Nano](https://quelleia.com/modeles/gpt-5-4-nano.md) | OpenAI | Maximale | 80,3 % | 72,2 | https://conceptualreasoning.ai/dtbench |
| 73 | [Qwen3-235B-A22B-Thinking (Jul 2025)](https://quelleia.com/modeles/qwen3-235b-a22b-thinking-jul-2025.md) | Alibaba | non précisée | 80,3 % | 72,2 | https://conceptualreasoning.ai/dtbench |
| 75 | [GPT-5.4 Mini](https://quelleia.com/modeles/gpt-5-4-mini.md) | OpenAI | Maximale | 80 % | 72,0 | https://conceptualreasoning.ai/dtbench |
| 75 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | non précisée | 80 % | 72,0 | https://conceptualreasoning.ai/dtbench |
| 75 | [Qwen3.5-35B-A3B](https://quelleia.com/modeles/qwen3-5-35b-a3b.md) | Alibaba | non précisée | 80 % | 72,0 | https://conceptualreasoning.ai/dtbench |
| 78 | [MiniMax-M3](https://quelleia.com/modeles/minimax-m3.md) | MiniMax | non précisée | 78,9 % | 70,8 | https://conceptualreasoning.ai/dtbench |
| 79 | [Qwen3-235B-A22B-Instruct (Jul 2025)](https://quelleia.com/modeles/qwen3-235b-a22b-instruct-jul-2025.md) | Alibaba | non précisée | 78,4 % | 70,3 | https://conceptualreasoning.ai/dtbench |
| 80 | [Qwen3.6 27B](https://quelleia.com/modeles/qwen3-6-27b.md) | Alibaba | non précisée | 78,1 % | 70,0 | https://conceptualreasoning.ai/dtbench |
| 81 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Élevée | 77,6 % | 69,5 | https://conceptualreasoning.ai/dtbench |
| 82 | [Qwen 3.6 Flash](https://quelleia.com/modeles/qwen-3-6-flash.md) | Alibaba | non précisée | 77,1 % | 68,9 | https://conceptualreasoning.ai/dtbench |
| 82 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | non précisée | 77,1 % | 68,9 | https://conceptualreasoning.ai/dtbench |
| 84 | [Gemini 3.1 Flash-Lite](https://quelleia.com/modeles/gemini-3-1-flash-lite.md) | Google DeepMind | Élevée | 76,8 % | 68,7 | https://conceptualreasoning.ai/dtbench |
| 85 | [Gemini 2.5 Flash (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-flash-jun-2025.md) | Google DeepMind | non précisée | 76,5 % | 68,4 | https://conceptualreasoning.ai/dtbench |
| 86 | [gpt-oss-120b](https://quelleia.com/modeles/gpt-oss-120b.md) | OpenAI | Élevée | 76,3 % | 68,1 | https://conceptualreasoning.ai/dtbench |
| 87 | [Qwen3-235B-A22B](https://quelleia.com/modeles/qwen3-235b-a22b.md) | Alibaba | non précisée | 75,7 % | 67,6 | https://conceptualreasoning.ai/dtbench |
| 88 | [Mistral Medium 3.5](https://quelleia.com/modeles/mistral-medium-3-5.md) | Mistral AI | non précisée | 75,5 % | 67,4 | https://conceptualreasoning.ai/dtbench |
| 89 | [Gemma 4 26B A4B](https://quelleia.com/modeles/gemma-4-26b-a4b.md) | Google DeepMind | non précisée | 74,9 % | 66,8 | https://conceptualreasoning.ai/dtbench |
| 90 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Élevée | 74,7 % | 66,6 | https://conceptualreasoning.ai/dtbench |
| 91 | [Qwen 3.6 35B-A3B](https://quelleia.com/modeles/qwen-3-6-35b-a3b.md) | Alibaba | non précisée | 73,9 % | 65,8 | https://conceptualreasoning.ai/dtbench |
| 92 | [Claude Haiku 4.5](https://quelleia.com/modeles/claude-haiku-4-5.md) | Anthropic | non précisée | 73,6 % | 65,6 | https://conceptualreasoning.ai/dtbench |
| 93 | [Qwen3.5-9B](https://quelleia.com/modeles/qwen3-5-9b.md) | Alibaba | non précisée | 71,2 % | 63,3 | https://conceptualreasoning.ai/dtbench |
| 94 | [Mistral Small 4](https://quelleia.com/modeles/mistral-small-4.md) | Mistral AI | non précisée | 70,9 % | 63,0 | https://conceptualreasoning.ai/dtbench |
| 95 | [Qwen3-30B-A3B-Thinking (Jul 2025)](https://quelleia.com/modeles/qwen3-30b-a3b-thinking-jul-2025.md) | Alibaba | non précisée | 69,3 % | 61,5 | https://conceptualreasoning.ai/dtbench |
| 96 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 68,8 % | 61,0 | https://conceptualreasoning.ai/dtbench |
| 96 | [GPT-4.1 mini](https://quelleia.com/modeles/gpt-4-1-mini.md) | OpenAI | non précisée | 68,8 % | 61,0 | https://conceptualreasoning.ai/dtbench |
| 98 | [GPT-4.1](https://quelleia.com/modeles/gpt-4-1.md) | OpenAI | non précisée | 68,3 % | 60,5 | https://conceptualreasoning.ai/dtbench |
| 99 | [gpt-oss-20b](https://quelleia.com/modeles/gpt-oss-20b.md) | OpenAI | Élevée | 68 % | 60,2 | https://conceptualreasoning.ai/dtbench |
| 100 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 67,8 % | 60,1 | https://conceptualreasoning.ai/dtbench |
| 101 | [Claude 3.5 Sonnet](https://quelleia.com/modeles/claude-3-5-sonnet.md) | Anthropic | non précisée | 67,8 % | 60,0 | https://conceptualreasoning.ai/dtbench |
| 102 | [Mistral Medium 3.1](https://quelleia.com/modeles/mistral-medium-3-1.md) | Mistral AI | non précisée | 67,5 % | 59,7 | https://conceptualreasoning.ai/dtbench |
| 102 | [Qwen3-32B](https://quelleia.com/modeles/qwen3-32b.md) | Alibaba | non précisée | 67,5 % | 59,7 | https://conceptualreasoning.ai/dtbench |
| 104 | [Qwen3-30B-A3B-Instruct (Jul 2025)](https://quelleia.com/modeles/qwen3-30b-a3b-instruct-jul-2025.md) | Alibaba | non précisée | 67,2 % | 59,5 | https://conceptualreasoning.ai/dtbench |
| 105 | [Grok-2 (Dec 2024)](https://quelleia.com/modeles/grok-2-dec-2024.md) | xAI | non précisée | 65,2 % | 57,6 | https://conceptualreasoning.ai/dtbench |
| 106 | [Mistral Large 3](https://quelleia.com/modeles/mistral-large-3.md) | Mistral AI | non précisée | 65,1 % | 57,4 | https://conceptualreasoning.ai/dtbench |
| 107 | [DeepSeek-V3 (Mar 2025)](https://quelleia.com/modeles/deepseek-v3-mar-2025.md) | DeepSeek | non précisée | 64,8 % | 57,2 | https://conceptualreasoning.ai/dtbench |
| 108 | [GPT-4o (May 2024)](https://quelleia.com/modeles/gpt-4o-may-2024.md) | OpenAI | non précisée | 64,5 % | 56,9 | https://conceptualreasoning.ai/dtbench |
| 109 | [Qwen3-14B](https://quelleia.com/modeles/qwen3-14b.md) | Alibaba | non précisée | 64 % | 56,4 | https://conceptualreasoning.ai/dtbench |
| 110 | [Gemini 2.0 Flash (Feb 2025)](https://quelleia.com/modeles/gemini-2-0-flash-feb-2025.md) | Google DeepMind | non précisée | 63,2 % | 55,6 | https://conceptualreasoning.ai/dtbench |
| 111 | [Qwen2.5-72B](https://quelleia.com/modeles/qwen2-5-72b.md) | Alibaba | non précisée | 62,9 % | 55,3 | https://conceptualreasoning.ai/dtbench |
| 112 | [Gemini 2.5 Flash-Lite (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-flash-lite-jun-2025.md) | Google DeepMind | non précisée | 62,8 % | 55,2 | https://conceptualreasoning.ai/dtbench |
| 113 | [GPT-5 nano](https://quelleia.com/modeles/gpt-5-nano.md) | OpenAI | Élevée | 62,7 % | 55,1 | https://conceptualreasoning.ai/dtbench |
| 113 | [GPT-4 (Jun 2023)](https://quelleia.com/modeles/gpt-4-jun-2023.md) | OpenAI | non précisée | 62,7 % | 55,1 | https://conceptualreasoning.ai/dtbench |
| 115 | [Mistral Medium 3](https://quelleia.com/modeles/mistral-medium-3.md) | Mistral AI | non précisée | 62,3 % | 54,7 | https://conceptualreasoning.ai/dtbench |
| 116 | [Llama 4 Maverick](https://quelleia.com/modeles/llama-4-maverick.md) | Meta AI | non précisée | 61,9 % | 54,3 | https://conceptualreasoning.ai/dtbench |
| 117 | [Claude 3 Opus](https://quelleia.com/modeles/claude-3-opus.md) | Anthropic | non précisée | 61,6 % | 54,0 | https://conceptualreasoning.ai/dtbench |
| 117 | [GPT-4 Turbo (Nov 2023)](https://quelleia.com/modeles/gpt-4-turbo-nov-2023.md) | OpenAI | non précisée | 61,6 % | 54,0 | https://conceptualreasoning.ai/dtbench |
| 119 | [Llama 3.1-405B](https://quelleia.com/modeles/llama-3-1-405b.md) | Meta AI | non précisée | 61,4 % | 53,8 | https://conceptualreasoning.ai/dtbench |
| 120 | [Cohere Command A](https://quelleia.com/modeles/cohere-command-a.md) | Cohere | non précisée | 61,3 % | 53,7 | https://conceptualreasoning.ai/dtbench |
| 121 | [Magistral Small 1.2](https://quelleia.com/modeles/magistral-small-1-2.md) | Mistral AI | non précisée | 61,3 % | 53,7 | https://conceptualreasoning.ai/dtbench |
| 122 | [Mistral Large 2 (Jul 2024)](https://quelleia.com/modeles/mistral-large-2-jul-2024.md) | Mistral AI | non précisée | 61,2 % | 53,6 | https://conceptualreasoning.ai/dtbench |
| 123 | [Mistral Large 2 (Nov 2024)](https://quelleia.com/modeles/mistral-large-2-nov-2024.md) | Mistral AI | non précisée | 60,8 % | 53,2 | https://conceptualreasoning.ai/dtbench |
| 124 | [Qwen3-30B-A3B](https://quelleia.com/modeles/qwen3-30b-a3b.md) | Alibaba | non précisée | 60,3 % | 52,6 | https://conceptualreasoning.ai/dtbench |
| 125 | [Llama 3.1-70B](https://quelleia.com/modeles/llama-3-1-70b.md) | Meta AI | non précisée | 60 % | 52,3 | https://conceptualreasoning.ai/dtbench |
| 126 | [Mistral Small 3.2](https://quelleia.com/modeles/mistral-small-3-2.md) | Mistral AI | non précisée | 59,9 % | 52,2 | https://conceptualreasoning.ai/dtbench |
| 127 | [Qwen3-8B](https://quelleia.com/modeles/qwen3-8b.md) | Alibaba | non précisée | 59,7 % | 52,0 | https://conceptualreasoning.ai/dtbench |
| 128 | [Llama 3.3 70B](https://quelleia.com/modeles/llama-3-3-70b.md) | Meta AI | non précisée | 59,5 % | 51,7 | https://conceptualreasoning.ai/dtbench |
| 129 | [Gemini 1.5 Pro (Sept 2024)](https://quelleia.com/modeles/gemini-1-5-pro-sept-2024.md) | Google DeepMind | non précisée | 59 % | 51,2 | https://conceptualreasoning.ai/dtbench |
| 130 | [Mistral Small 3.1](https://quelleia.com/modeles/mistral-small-3-1.md) | Mistral AI | non précisée | 58,6 % | 50,8 | https://conceptualreasoning.ai/dtbench |
| 131 | [Llama 4 Scout](https://quelleia.com/modeles/llama-4-scout.md) | Meta AI | non précisée | 57,9 % | 50,0 | https://conceptualreasoning.ai/dtbench |
| 132 | [Claude 3.5 Haiku](https://quelleia.com/modeles/claude-3-5-haiku.md) | Anthropic | non précisée | 56,7 % | 48,6 | https://conceptualreasoning.ai/dtbench |
| 133 | [Gemini 1.5 Pro (May 2024)](https://quelleia.com/modeles/gemini-1-5-pro-may-2024.md) | Google DeepMind | non précisée | 56,5 % | 48,4 | https://conceptualreasoning.ai/dtbench |
| 134 | [Mistral Large](https://quelleia.com/modeles/mistral-large.md) | Mistral AI | non précisée | 55,9 % | 47,7 | https://conceptualreasoning.ai/dtbench |
| 135 | [Mixtral 8x22B](https://quelleia.com/modeles/mixtral-8x22b.md) | Mistral AI | non précisée | 55,1 % | 46,7 | https://conceptualreasoning.ai/dtbench |
| 136 | [Command R+](https://quelleia.com/modeles/command-r.md) | Cohere | non précisée | 54,9 % | 46,5 | https://conceptualreasoning.ai/dtbench |
| 137 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 54,4 % | 45,8 | https://conceptualreasoning.ai/dtbench |
| 138 | [Llama 3-70B](https://quelleia.com/modeles/llama-3-70b.md) | Meta AI | non précisée | 54,2 % | 45,5 | https://conceptualreasoning.ai/dtbench |
| 139 | [Gemini 1.5 Flash (Sep 2024)](https://quelleia.com/modeles/gemini-1-5-flash-sep-2024.md) | Google DeepMind | non précisée | 53,8 % | 45,0 | https://conceptualreasoning.ai/dtbench |
| 140 | [Claude 3 Sonnet](https://quelleia.com/modeles/claude-3-sonnet.md) | Anthropic | non précisée | 53,6 % | 44,7 | https://conceptualreasoning.ai/dtbench |
| 141 | [Mistral Medium](https://quelleia.com/modeles/mistral-medium.md) | Mistral AI | non précisée | 53,3 % | 44,3 | https://conceptualreasoning.ai/dtbench |
| 142 | [mistral-small-2402](https://quelleia.com/modeles/mistral-small-2402.md) | Mistral AI | non précisée | 53 % | 43,9 | https://conceptualreasoning.ai/dtbench |
| 143 | [Gemma 3 27B](https://quelleia.com/modeles/gemma-3-27b.md) | Google DeepMind | non précisée | 52,5 % | 43,3 | https://conceptualreasoning.ai/dtbench |
| 143 | [Gemini 2.0 Flash-Lite](https://quelleia.com/modeles/gemini-2-0-flash-lite.md) | Google DeepMind | non précisée | 52,5 % | 43,3 | https://conceptualreasoning.ai/dtbench |
| 143 | [GPT-4.1 nano](https://quelleia.com/modeles/gpt-4-1-nano.md) | OpenAI | non précisée | 52,5 % | 43,3 | https://conceptualreasoning.ai/dtbench |
| 146 | [Claude 2](https://quelleia.com/modeles/claude-2.md) | Anthropic | non précisée | 51,9 % | 42,3 | https://conceptualreasoning.ai/dtbench |
| 147 | [Ministral 3B](https://quelleia.com/modeles/ministral-3b.md) | Mistral AI | non précisée | 51,7 % | 42,1 | https://conceptualreasoning.ai/dtbench |
| 148 | [Gemini 1.5 Flash (May 2024)](https://quelleia.com/modeles/gemini-1-5-flash-may-2024.md) | Google DeepMind | non précisée | 51,4 % | 41,6 | https://conceptualreasoning.ai/dtbench |
| 149 | [Claude 2.1](https://quelleia.com/modeles/claude-2-1.md) | Anthropic | non précisée | 51 % | 40,9 | https://conceptualreasoning.ai/dtbench |
| 150 | [Gemma 3 4B](https://quelleia.com/modeles/gemma-3-4b.md) | Google DeepMind | non précisée | 50,9 % | 40,9 | https://conceptualreasoning.ai/dtbench |
| 150 | [Llama 3.1-8B](https://quelleia.com/modeles/llama-3-1-8b.md) | Meta AI | non précisée | 50,9 % | 40,9 | https://conceptualreasoning.ai/dtbench |
| 152 | [Claude 3 Haiku](https://quelleia.com/modeles/claude-3-haiku.md) | Anthropic | non précisée | 50,1 % | 39,5 | https://conceptualreasoning.ai/dtbench |
| 153 | [Gemini 1.5 Flash 8B](https://quelleia.com/modeles/gemini-1-5-flash-8b.md) | Google DeepMind | non précisée | 50 % | 39,4 | https://conceptualreasoning.ai/dtbench |
| 154 | [Mixtral 8x7B](https://quelleia.com/modeles/mixtral-8x7b.md) | Mistral AI | non précisée | 49,6 % | 38,7 | https://conceptualreasoning.ai/dtbench |
| 155 | [Mistral Small v24.09](https://quelleia.com/modeles/mistral-small-v24-09.md) | Mistral AI | non précisée | 49,5 % | 38,5 | https://conceptualreasoning.ai/dtbench |
| 156 | [Gemma 3 12B](https://quelleia.com/modeles/gemma-3-12b.md) | Google DeepMind | non précisée | 48,8 % | 37,2 | https://conceptualreasoning.ai/dtbench |
| 157 | [Mistral NeMo](https://quelleia.com/modeles/mistral-nemo.md) | Mistral AI | non précisée | 48,6 % | 36,8 | https://conceptualreasoning.ai/dtbench |
| 158 | [GPT-3.5 Turbo (Jan 2024)](https://quelleia.com/modeles/gpt-3-5-turbo-jan-2024.md) | OpenAI | non précisée | 48,5 % | 36,7 | https://conceptualreasoning.ai/dtbench |
| 159 | [Gemma 2 27B](https://quelleia.com/modeles/gemma-2-27b.md) | Google DeepMind | non précisée | 48 % | 35,6 | https://conceptualreasoning.ai/dtbench |
| 160 | [Qwen2.5-7B](https://quelleia.com/modeles/qwen2-5-7b.md) | Alibaba | non précisée | 47,7 % | 35,0 | https://conceptualreasoning.ai/dtbench |
| 161 | [c4ai-command-r-08-2024](https://quelleia.com/modeles/c4ai-command-r-08-2024.md) | Cohere | non précisée | 46,4 % | 32,0 | https://conceptualreasoning.ai/dtbench |
| 162 | [Gemini 1.0 Pro](https://quelleia.com/modeles/gemini-1-0-pro.md) | Google DeepMind | non précisée | 45,9 % | 30,6 | https://conceptualreasoning.ai/dtbench |
| 163 | [Claude Instant](https://quelleia.com/modeles/claude-instant.md) | Anthropic | non précisée | 45,8 % | 30,4 | https://conceptualreasoning.ai/dtbench |
| 164 | [Ministral 8B](https://quelleia.com/modeles/ministral-8b.md) | Mistral AI | non précisée | 45,7 % | 30,2 | https://conceptualreasoning.ai/dtbench |
| 165 | [Llama 3-8B](https://quelleia.com/modeles/llama-3-8b.md) | Meta AI | non précisée | 43,9 % | 24,5 | https://conceptualreasoning.ai/dtbench |
| 166 | [Mistral 7B v0.3](https://quelleia.com/modeles/mistral-7b-v0-3.md) | Mistral AI | non précisée | 42,5 % | 17,9 | https://conceptualreasoning.ai/dtbench |
| 167 | [Llama 2-13B](https://quelleia.com/modeles/llama-2-13b.md) | Meta AI | non précisée | 42,2 % | 16,1 | https://conceptualreasoning.ai/dtbench |
| 168 | [Llama 2-70B](https://quelleia.com/modeles/llama-2-70b.md) | Meta AI | non précisée | 41,7 % | 11,6 | https://conceptualreasoning.ai/dtbench |

## En bref

**Que mesure DTBench ?** 407 questions de théorie de la décision sur des dilemmes de type Newcomb, où le choix d'un agent renseigne sur celui de ses semblables. Sur Quelle IA, il est rangé dans la tâche Raisonnement.

**Comment DTBench est-il noté ?** Part de bonnes réponses ; le hasard donne 40 %. Un modèle qui obtient 70 % a un score IA d'environ 62.

**Qui est en tête sur DTBench ?** Claude Opus 5.5 (Anthropic) est en tête de DTBench avec 98,9 %, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5 (98,4 %) et Claude Opus 5 (97,9 %). 168 modèles y sont mesurés.

**Quelles sont les limites de DTBench ?** Domaine très étroit, et les meilleurs modèles frôlent 99 %. Les questions d'opinion du jeu sont exclues du score. Au 28 septembre 2026, le benchmark est saturé.

**Combien pèse DTBench dans le score IA ?** DTBench compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Raisonnement (15 % du score général), que se partagent 9 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

**Qui maintient DTBench ?** Redwood Research. Sa page de référence : conceptualreasoning.ai/dtbench.

## Les autres benchmarks de la tâche Raisonnement

- [Chess Puzzles](https://quelleia.com/benchmarks/chess_puzzles.md) : 136 modèles · 1,67 % du score
- [LMCA](https://quelleia.com/benchmarks/lmca.md) : 130 modèles · 1,67 % du score
- [ARC-AGI-1](https://quelleia.com/benchmarks/arc_agi.md) : 82 modèles · 1,67 % du score, saturé
- [SimpleBench](https://quelleia.com/benchmarks/simplebench.md) : 82 modèles · 1,67 % du score
- [ARC-AGI-2](https://quelleia.com/benchmarks/arc_agi_2.md) : 80 modèles · 1,67 % du score, saturé
- [ForecastBench](https://quelleia.com/benchmarks/forecastbench.md) : 77 modèles · 1,67 % du score
- [Mystery Game Puzzles](https://quelleia.com/benchmarks/mystery_game_puzzles.md) : 69 modèles · 1,67 % du score
- [EnigmaEval](https://quelleia.com/benchmarks/enigmaeval.md) : 41 modèles · 1,67 % du score
- [LiveBench, raisonnement](https://quelleia.com/benchmarks/livebench_raisonnement.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
