# LiveBench

> Fiche du benchmark LiveBench sur Quelle IA, édition du 28 septembre 2026. Un test généraliste aux questions renouvelées régulièrement : raisonnement, code, maths, analyse de données, langue et respect des consignes. En tête au 28 septembre 2026 : Gemini 2.5 Pro (Mar 2025) (82,4 %). Notation, limites et classement des 48 modèles mesurés.

Page : https://quelleia.com/benchmarks/livebench/
Source du benchmark : https://livebench.ai/
Mainteneur : Équipe LiveBench (White et al., Abacus.AI)
Tâche : Tests historiques
État : archivé

## À quoi il sert

LiveBench est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

## Comment c'est noté

Moyenne sur 100 des catégories ; chaque question a une réponse objective, corrigée automatiquement sans IA correctrice.

## Ce qu'il ne dit pas

Les données d'Epoch sont figées sur le jeu de questions de novembre 2024 et ne contiennent aucun modèle sorti après novembre 2025.

## Qui le tient

Équipe LiveBench (White et al., Abacus.AI).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 51. Le meilleur, Gemini 2.5 Pro (Mar 2025), atteint 82,4 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 50 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 82 %
- Score IA 100 (niveau de Claude Opus 5.5) : 95 %

## Son poids dans le score IA

0 % du score général. LiveBench est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

## Classement (48 modèles mesurés · 54 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Gemini 2.5 Pro (Mar 2025)](https://quelleia.com/modeles/gemini-2-5-pro-mar-2025.md) | Google DeepMind | non précisée | 82,4 % | 77,0 | https://epoch.ai/benchmarks |
| 2 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Élevée | 78,8 % | 73,1 | https://epoch.ai/benchmarks |
| 3 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | non précisée | 76,1 % | 70,5 | https://epoch.ai/benchmarks |
| 4 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 75,9 % | 70,3 | https://epoch.ai/benchmarks |
| 5 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Élevée | 75,7 % | 70,1 | https://epoch.ai/benchmarks |
| 6 | [QwQ-32B](https://quelleia.com/modeles/qwq-32b.md) | Alibaba | non précisée | 72 % | 66,9 | https://epoch.ai/benchmarks |
| 7 | [DeepSeek-R1](https://quelleia.com/modeles/deepseek-r1.md) | DeepSeek | non précisée | 71,6 % | 66,6 | https://epoch.ai/benchmarks |
| 8 | [GPT-4.5](https://quelleia.com/modeles/gpt-4-5.md) | OpenAI | non précisée | 69 % | 64,5 | https://epoch.ai/benchmarks |
| 9 | [Gemini 2.0 Flash Thinking (Jan 2025)](https://quelleia.com/modeles/gemini-2-0-flash-thinking-jan-2025.md) | Google DeepMind | non précisée | 66,9 % | 62,9 | https://epoch.ai/benchmarks |
| 10 | [DeepSeek-V3 (Mar 2025)](https://quelleia.com/modeles/deepseek-v3-mar-2025.md) | DeepSeek | non précisée | 66,9 % | 62,9 | https://epoch.ai/benchmarks |
| 11 | [Gemini 2.0 Pro](https://quelleia.com/modeles/gemini-2-0-pro.md) | Google DeepMind | non précisée | 65,1 % | 61,6 | https://epoch.ai/benchmarks |
| 12 | [Gemini 2.0 Flash (Dec 2024)](https://quelleia.com/modeles/gemini-2-0-flash-dec-2024.md) | Google DeepMind | non précisée | 64,1 % | 60,8 | https://epoch.ai/benchmarks |
| 13 | [Qwen2.5-Max](https://quelleia.com/modeles/qwen2-5-max.md) | Alibaba | non précisée | 62,3 % | 59,5 | https://epoch.ai/benchmarks |
| 14 | [Gemini 2.0 Flash (Feb 2025)](https://quelleia.com/modeles/gemini-2-0-flash-feb-2025.md) | Google DeepMind | non précisée | 61,5 % | 58,9 | https://epoch.ai/benchmarks |
| 15 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 60,5 % | 58,2 | https://epoch.ai/benchmarks |
| 16 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 59 % | 57,2 | https://epoch.ai/benchmarks |
| 17 | [o1-mini](https://quelleia.com/modeles/o1-mini.md) | OpenAI | Moyenne | 57,8 % | 56,3 | https://epoch.ai/benchmarks |
| 18 | [GPT-4o (Aug 2024)](https://quelleia.com/modeles/gpt-4o-aug-2024.md) | OpenAI | non précisée | 55,3 % | 54,7 | https://epoch.ai/benchmarks |
| 19 | [DeepSeek-R1-Distill-Llama-70B](https://quelleia.com/modeles/deepseek-r1-distill-llama-70b.md) | DeepSeek | non précisée | 54,5 % | 54,1 | https://epoch.ai/benchmarks |
| 20 | [Grok-2 (Dec 2024)](https://quelleia.com/modeles/grok-2-dec-2024.md) | xAI | non précisée | 54,3 % | 54,0 | https://epoch.ai/benchmarks |
| 21 | [Gemini 2.0 Flash-Lite](https://quelleia.com/modeles/gemini-2-0-flash-lite.md) | Google DeepMind | non précisée | 54,3 % | 54,0 | https://epoch.ai/benchmarks |
| 22 | [Dracarys2-72B-Instruct](https://quelleia.com/modeles/dracarys2-72b-instruct.md) |  | non précisée | 52,6 % | 52,9 | https://epoch.ai/benchmarks |
| 23 | [learnlm-1.5-pro-experimental](https://quelleia.com/modeles/learnlm-1-5-pro-experimental.md) | Google DeepMind | non précisée | 52,2 % | 52,6 | https://epoch.ai/benchmarks |
| 23 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 52,2 % | 52,6 | https://epoch.ai/benchmarks |
| 25 | [Llama 3.3 70B](https://quelleia.com/modeles/llama-3-3-70b.md) | Meta AI | non précisée | 50,2 % | 51,2 | https://epoch.ai/benchmarks |
| 26 | [Gemma 3 27B](https://quelleia.com/modeles/gemma-3-27b.md) | Google DeepMind | non précisée | 50 % | 51,1 | https://epoch.ai/benchmarks |
| 27 | [Claude 3 Opus](https://quelleia.com/modeles/claude-3-opus.md) | Anthropic | non précisée | 49,2 % | 50,5 | https://epoch.ai/benchmarks |
| 28 | [Mistral Large 2 (Nov 2024)](https://quelleia.com/modeles/mistral-large-2-nov-2024.md) | Mistral AI | non précisée | 48,4 % | 50,0 | https://epoch.ai/benchmarks |
| 29 | [sonar](https://quelleia.com/modeles/sonar.md) | Perplexity | non précisée | 46,9 % | 49,0 | https://epoch.ai/benchmarks |
| 30 | [Qwen2.5-Coder-32B-Instruct](https://quelleia.com/modeles/qwen2-5-coder-32b-instruct.md) | Alibaba | non précisée | 46,2 % | 48,5 | https://epoch.ai/benchmarks |
| 31 | [Dracarys2-Llama-3.1-70B-Instruct](https://quelleia.com/modeles/dracarys2-llama-3-1-70b-instruct.md) |  | non précisée | 46,2 % | 48,5 | https://epoch.ai/benchmarks |
| 32 | [DeepSeek-R1-Distill-Qwen-32B](https://quelleia.com/modeles/deepseek-r1-distill-qwen-32b.md) | DeepSeek | non précisée | 45,6 % | 48,1 | https://epoch.ai/benchmarks |
| 33 | [Mistral Small 3.1](https://quelleia.com/modeles/mistral-small-3-1.md) | Mistral AI | non précisée | 44 % | 47,0 | https://epoch.ai/benchmarks |
| 34 | [Amazon Nova Pro](https://quelleia.com/modeles/amazon-nova-pro.md) | Amazon | non précisée | 43,5 % | 46,7 | https://epoch.ai/benchmarks |
| 35 | [Claude 3.5 Haiku](https://quelleia.com/modeles/claude-3-5-haiku.md) | Anthropic | non précisée | 43,5 % | 46,7 | https://epoch.ai/benchmarks |
| 36 | [Mistral Small 3](https://quelleia.com/modeles/mistral-small-3.md) | Mistral AI | non précisée | 42,6 % | 46,0 | https://epoch.ai/benchmarks |
| 37 | [Phi-4](https://quelleia.com/modeles/phi-4.md) | Microsoft | non précisée | 41,6 % | 45,4 | https://epoch.ai/benchmarks |
| 38 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 41,3 % | 45,2 | https://epoch.ai/benchmarks |
| 39 | [QwQ-32B-Preview](https://quelleia.com/modeles/qwq-32b-preview.md) | Alibaba | non précisée | 40,3 % | 44,4 | https://epoch.ai/benchmarks |
| 40 | [Gemma 2 27B](https://quelleia.com/modeles/gemma-2-27b.md) | Google DeepMind | non précisée | 38,2 % | 43,0 | https://epoch.ai/benchmarks |
| 41 | [Amazon Nova Lite](https://quelleia.com/modeles/amazon-nova-lite.md) | Amazon | non précisée | 36,4 % | 41,7 | https://epoch.ai/benchmarks |
| 42 | [Command R+](https://quelleia.com/modeles/command-r.md) | Cohere | non précisée | 31,8 % | 38,2 | https://epoch.ai/benchmarks |
| 43 | [Amazon Nova Micro](https://quelleia.com/modeles/amazon-nova-micro.md) | Amazon | non précisée | 29,6 % | 36,5 | https://epoch.ai/benchmarks |
| 44 | [Gemma 2 9B](https://quelleia.com/modeles/gemma-2-9b.md) | Google DeepMind | non précisée | 28,7 % | 35,8 | https://epoch.ai/benchmarks |
| 45 | [c4ai-command-r-08-2024](https://quelleia.com/modeles/c4ai-command-r-08-2024.md) | Cohere | non précisée | 27,5 % | 34,8 | https://epoch.ai/benchmarks |
| 46 | [phi-3-small 7.4B](https://quelleia.com/modeles/phi-3-small-7-4b.md) | Microsoft | non précisée | 24 % | 31,8 | https://epoch.ai/benchmarks |
| 47 | [phi-3-mini 3.8B](https://quelleia.com/modeles/phi-3-mini-3-8b.md) | Microsoft | non précisée | 22,4 % | 30,2 | https://epoch.ai/benchmarks |
| 48 | [OLMo 2 Furious 13B](https://quelleia.com/modeles/olmo-2-furious-13b.md) | Allen Institute for AI | non précisée | 22,1 % | 29,9 | https://epoch.ai/benchmarks |

## En bref

**Que mesure LiveBench ?** Un test généraliste aux questions renouvelées régulièrement : raisonnement, code, maths, analyse de données, langue et respect des consignes. C'est un test historique, hors des scores d'aujourd'hui.

**Comment LiveBench est-il noté ?** Moyenne sur 100 des catégories ; chaque question a une réponse objective, corrigée automatiquement sans IA correctrice. Un modèle qui obtient 50 % a un score IA d'environ 51.

**Qui est en tête sur LiveBench ?** Gemini 2.5 Pro (Mar 2025) (Google DeepMind) est en tête de LiveBench avec 82,4 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.1 (78,8 %) et Claude 3.7 Sonnet (76,1 %). 48 modèles y sont mesurés.

**Quelles sont les limites de LiveBench ?** Les données d'Epoch sont figées sur le jeu de questions de novembre 2024 et ne contiennent aucun modèle sorti après novembre 2025. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse LiveBench dans le score IA ?** LiveBench compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

**Qui maintient LiveBench ?** Équipe LiveBench (White et al., Abacus.AI). Sa page de référence : livebench.ai.

## Les autres tests historiques

- [MMLU](https://quelleia.com/benchmarks/mmlu.md) : 127 modèles · hors score, archivé
- [WinoGrande](https://quelleia.com/benchmarks/winogrande.md) : 77 modèles · hors score, archivé
- [ARC (AI2 Reasoning Challenge)](https://quelleia.com/benchmarks/arc_ai2.md) : 76 modèles · hors score, archivé
- [BoolQ](https://quelleia.com/benchmarks/boolq.md) : 76 modèles · hors score, archivé
- [HellaSwag](https://quelleia.com/benchmarks/hellaswag.md) : 75 modèles · hors score, archivé
- [PIQA](https://quelleia.com/benchmarks/piqa.md) : 59 modèles · hors score, archivé
- [BIG-Bench Hard (BBH)](https://quelleia.com/benchmarks/bbh.md) : 45 modèles · hors score, archivé
- [OpenBookQA](https://quelleia.com/benchmarks/openbookqa.md) : 42 modèles · hors score, archivé
- [TriviaQA](https://quelleia.com/benchmarks/triviaqa.md) : 38 modèles · hors score, archivé
- [LAMBADA](https://quelleia.com/benchmarks/lambada.md) : 26 modèles · hors score, archivé
- [ScienceQA](https://quelleia.com/benchmarks/scienceqa.md) : 23 modèles · hors score, archivé
- [ANLI (Adversarial NLI)](https://quelleia.com/benchmarks/anli.md) : 11 modèles · hors score, archivé
- [SuperGLUE](https://quelleia.com/benchmarks/superglue.md) : 8 modèles · hors score, archivé
- [CommonsenseQA 2.0](https://quelleia.com/benchmarks/csqa2.md) : 6 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
