# LiveBench, raisonnement

> Fiche du benchmark LiveBench, raisonnement sur Quelle IA, édition du 28 septembre 2026. Des énigmes logiques et des déductions dont les questions sont renouvelées régulièrement. En tête au 28 septembre 2026 : GPT-5.1 (95,8 %). Notation, limites et classement des 48 modèles mesurés.

Page : https://quelleia.com/benchmarks/livebench_raisonnement/
Source du benchmark : https://livebench.ai
Mainteneur : LiveBench (Abacus.AI, NYU et coauteurs)
Tâche : Raisonnement
État : archivé

## À quoi il sert

LiveBench, raisonnement servait à noter la tâche Raisonnement. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

## Comment c'est noté

La part de bonnes réponses, vérifiée automatiquement, sans juge humain ni modèle juge.

## Ce qu'il ne dit pas

Les questions récentes ne sont pas publiées. Dernière édition en juin 2026.

## Qui le tient

LiveBench (Abacus.AI, NYU et coauteurs).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 52. Le meilleur, GPT-5.1, atteint 95,8 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 49 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 89 %
- Score IA 100 (niveau de Claude Opus 5.5) : 98 %

## Son poids dans le score IA

0 % du score général. LiveBench, raisonnement est archivé et ne compte plus : la tâche Raisonnement (15 % du score général) repose sur 9 autres benchmarks.

## Classement (48 modèles mesurés · 54 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Élevée | 95,8 % | 87,8 | https://epoch.ai/benchmarks |
| 2 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Élevée | 91,6 % | 79,4 | https://epoch.ai/benchmarks |
| 3 | [Gemini 2.5 Pro (Mar 2025)](https://quelleia.com/modeles/gemini-2-5-pro-mar-2025.md) | Google DeepMind | non précisée | 89,8 % | 76,9 | https://epoch.ai/benchmarks |
| 4 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 89,6 % | 76,6 | https://epoch.ai/benchmarks |
| 5 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | non précisée | 87,8 % | 74,6 | https://epoch.ai/benchmarks |
| 6 | [QwQ-32B](https://quelleia.com/modeles/qwq-32b.md) | Alibaba | non précisée | 83,5 % | 70,5 | https://epoch.ai/benchmarks |
| 7 | [DeepSeek-R1](https://quelleia.com/modeles/deepseek-r1.md) | DeepSeek | non précisée | 83,2 % | 70,3 | https://epoch.ai/benchmarks |
| 8 | [Gemini 2.0 Flash Thinking (Jan 2025)](https://quelleia.com/modeles/gemini-2-0-flash-thinking-jan-2025.md) | Google DeepMind | non précisée | 78,2 % | 66,5 | https://epoch.ai/benchmarks |
| 9 | [o1-mini](https://quelleia.com/modeles/o1-mini.md) | OpenAI | Moyenne | 72,3 % | 62,9 | https://epoch.ai/benchmarks |
| 10 | [GPT-4.5](https://quelleia.com/modeles/gpt-4-5.md) | OpenAI | non précisée | 71,1 % | 62,2 | https://epoch.ai/benchmarks |
| 11 | [DeepSeek-R1-Distill-Llama-70B](https://quelleia.com/modeles/deepseek-r1-distill-llama-70b.md) | DeepSeek | non précisée | 67,6 % | 60,3 | https://epoch.ai/benchmarks |
| 12 | [DeepSeek-V3 (Mar 2025)](https://quelleia.com/modeles/deepseek-v3-mar-2025.md) | DeepSeek | non précisée | 65,8 % | 59,4 | https://epoch.ai/benchmarks |
| 13 | [Gemini 2.0 Pro](https://quelleia.com/modeles/gemini-2-0-pro.md) | Google DeepMind | non précisée | 60,1 % | 56,5 | https://epoch.ai/benchmarks |
| 14 | [Gemini 2.0 Flash (Dec 2024)](https://quelleia.com/modeles/gemini-2-0-flash-dec-2024.md) | Google DeepMind | non précisée | 59,1 % | 56,0 | https://epoch.ai/benchmarks |
| 15 | [QwQ-32B-Preview](https://quelleia.com/modeles/qwq-32b-preview.md) | Alibaba | non précisée | 57,7 % | 55,4 | https://epoch.ai/benchmarks |
| 16 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 56,8 % | 54,9 | https://epoch.ai/benchmarks |
| 17 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 56,7 % | 54,9 | https://epoch.ai/benchmarks |
| 18 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 55,8 % | 54,5 | https://epoch.ai/benchmarks |
| 19 | [Gemini 2.0 Flash (Feb 2025)](https://quelleia.com/modeles/gemini-2-0-flash-feb-2025.md) | Google DeepMind | non précisée | 55,3 % | 54,2 | https://epoch.ai/benchmarks |
| 20 | [Grok-2 (Dec 2024)](https://quelleia.com/modeles/grok-2-dec-2024.md) | xAI | non précisée | 54,8 % | 54,0 | https://epoch.ai/benchmarks |
| 21 | [GPT-4o (Aug 2024)](https://quelleia.com/modeles/gpt-4o-aug-2024.md) | OpenAI | non précisée | 53,9 % | 53,6 | https://epoch.ai/benchmarks |
| 22 | [DeepSeek-R1-Distill-Qwen-32B](https://quelleia.com/modeles/deepseek-r1-distill-qwen-32b.md) | DeepSeek | non précisée | 52,3 % | 52,8 | https://epoch.ai/benchmarks |
| 23 | [Qwen2.5-Max](https://quelleia.com/modeles/qwen2-5-max.md) | Alibaba | non précisée | 51,4 % | 52,5 | https://epoch.ai/benchmarks |
| 24 | [Llama 3.3 70B](https://quelleia.com/modeles/llama-3-3-70b.md) | Meta AI | non précisée | 50,8 % | 52,1 | https://epoch.ai/benchmarks |
| 25 | [Gemini 2.0 Flash-Lite](https://quelleia.com/modeles/gemini-2-0-flash-lite.md) | Google DeepMind | non précisée | 50,1 % | 51,8 | https://epoch.ai/benchmarks |
| 26 | [Phi-4](https://quelleia.com/modeles/phi-4.md) | Microsoft | non précisée | 47,8 % | 50,8 | https://epoch.ai/benchmarks |
| 27 | [Dracarys2-72B-Instruct](https://quelleia.com/modeles/dracarys2-72b-instruct.md) |  | non précisée | 47,4 % | 50,6 | https://epoch.ai/benchmarks |
| 28 | [sonar](https://quelleia.com/modeles/sonar.md) | Perplexity | non précisée | 46,3 % | 50,1 | https://epoch.ai/benchmarks |
| 29 | [Mistral Small 3.1](https://quelleia.com/modeles/mistral-small-3-1.md) | Mistral AI | non précisée | 44,8 % | 49,4 | https://epoch.ai/benchmarks |
| 30 | [Dracarys2-Llama-3.1-70B-Instruct](https://quelleia.com/modeles/dracarys2-llama-3-1-70b-instruct.md) |  | non précisée | 44,7 % | 49,3 | https://epoch.ai/benchmarks |
| 31 | [Gemma 3 27B](https://quelleia.com/modeles/gemma-3-27b.md) | Google DeepMind | non précisée | 43,8 % | 48,9 | https://epoch.ai/benchmarks |
| 32 | [Mistral Large 2 (Nov 2024)](https://quelleia.com/modeles/mistral-large-2-nov-2024.md) | Mistral AI | non précisée | 43,5 % | 48,8 | https://epoch.ai/benchmarks |
| 33 | [learnlm-1.5-pro-experimental](https://quelleia.com/modeles/learnlm-1-5-pro-experimental.md) | Google DeepMind | non précisée | 43,4 % | 48,7 | https://epoch.ai/benchmarks |
| 34 | [Qwen2.5-Coder-32B-Instruct](https://quelleia.com/modeles/qwen2-5-coder-32b-instruct.md) | Alibaba | non précisée | 42,1 % | 48,1 | https://epoch.ai/benchmarks |
| 35 | [Claude 3 Opus](https://quelleia.com/modeles/claude-3-opus.md) | Anthropic | non précisée | 40,6 % | 47,4 | https://epoch.ai/benchmarks |
| 36 | [Amazon Nova Lite](https://quelleia.com/modeles/amazon-nova-lite.md) | Amazon | non précisée | 36,7 % | 45,5 | https://epoch.ai/benchmarks |
| 37 | [Mistral Small 3](https://quelleia.com/modeles/mistral-small-3.md) | Mistral AI | non précisée | 36,4 % | 45,4 | https://epoch.ai/benchmarks |
| 38 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 32,8 % | 43,5 | https://epoch.ai/benchmarks |
| 39 | [Amazon Nova Pro](https://quelleia.com/modeles/amazon-nova-pro.md) | Amazon | non précisée | 32,6 % | 43,4 | https://epoch.ai/benchmarks |
| 40 | [Claude 3.5 Haiku](https://quelleia.com/modeles/claude-3-5-haiku.md) | Anthropic | non précisée | 28,1 % | 40,9 | https://epoch.ai/benchmarks |
| 40 | [Gemma 2 27B](https://quelleia.com/modeles/gemma-2-27b.md) | Google DeepMind | non précisée | 28,1 % | 40,9 | https://epoch.ai/benchmarks |
| 42 | [phi-3-mini 3.8B](https://quelleia.com/modeles/phi-3-mini-3-8b.md) | Microsoft | non précisée | 26,8 % | 40,2 | https://epoch.ai/benchmarks |
| 43 | [Amazon Nova Micro](https://quelleia.com/modeles/amazon-nova-micro.md) | Amazon | non précisée | 25,1 % | 39,2 | https://epoch.ai/benchmarks |
| 44 | [Command R+](https://quelleia.com/modeles/command-r.md) | Cohere | non précisée | 24,8 % | 38,9 | https://epoch.ai/benchmarks |
| 45 | [c4ai-command-r-08-2024](https://quelleia.com/modeles/c4ai-command-r-08-2024.md) | Cohere | non précisée | 21,9 % | 37,1 | https://epoch.ai/benchmarks |
| 46 | [OLMo 2 Furious 13B](https://quelleia.com/modeles/olmo-2-furious-13b.md) | Allen Institute for AI | non précisée | 16,3 % | 32,9 | https://epoch.ai/benchmarks |
| 47 | [phi-3-small 7.4B](https://quelleia.com/modeles/phi-3-small-7-4b.md) | Microsoft | non précisée | 15,9 % | 32,6 | https://epoch.ai/benchmarks |
| 48 | [Gemma 2 9B](https://quelleia.com/modeles/gemma-2-9b.md) | Google DeepMind | non précisée | 15,2 % | 31,9 | https://epoch.ai/benchmarks |

## En bref

**Que mesure LiveBench, raisonnement ?** Des énigmes logiques et des déductions dont les questions sont renouvelées régulièrement. Sur Quelle IA, il est rangé dans la tâche Raisonnement.

**Comment LiveBench, raisonnement est-il noté ?** La part de bonnes réponses, vérifiée automatiquement, sans juge humain ni modèle juge. Un modèle qui obtient 50 % a un score IA d'environ 52.

**Qui est en tête sur LiveBench, raisonnement ?** GPT-5.1 (OpenAI) est en tête de LiveBench, raisonnement avec 95,8 %, dans l'édition du 28 septembre 2026. Suivent o1 (91,6 %) et Gemini 2.5 Pro (Mar 2025) (89,8 %). 48 modèles y sont mesurés.

**Quelles sont les limites de LiveBench, raisonnement ?** Les questions récentes ne sont pas publiées. Dernière édition en juin 2026. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse LiveBench, raisonnement dans le score IA ?** LiveBench, raisonnement compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Raisonnement (15 % du score général) repose sur 9 autres benchmarks.

**Qui maintient LiveBench, raisonnement ?** LiveBench (Abacus.AI, NYU et coauteurs). Sa page de référence : livebench.ai.

## Les autres benchmarks de la tâche Raisonnement

- [DTBench](https://quelleia.com/benchmarks/dtbench.md) : 168 modèles · 1,67 % du score, saturé
- [Chess Puzzles](https://quelleia.com/benchmarks/chess_puzzles.md) : 136 modèles · 1,67 % du score
- [LMCA](https://quelleia.com/benchmarks/lmca.md) : 130 modèles · 1,67 % du score
- [ARC-AGI-1](https://quelleia.com/benchmarks/arc_agi.md) : 82 modèles · 1,67 % du score, saturé
- [SimpleBench](https://quelleia.com/benchmarks/simplebench.md) : 82 modèles · 1,67 % du score
- [ARC-AGI-2](https://quelleia.com/benchmarks/arc_agi_2.md) : 80 modèles · 1,67 % du score, saturé
- [ForecastBench](https://quelleia.com/benchmarks/forecastbench.md) : 77 modèles · 1,67 % du score
- [Mystery Game Puzzles](https://quelleia.com/benchmarks/mystery_game_puzzles.md) : 69 modèles · 1,67 % du score
- [EnigmaEval](https://quelleia.com/benchmarks/enigmaeval.md) : 41 modèles · 1,67 % du score

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
