# LiveBench, code

> Fiche du benchmark LiveBench, code sur Quelle IA, édition du 28 septembre 2026. Des exercices de programmation récents, tirés de concours publiés après la sortie des modèles. En tête au 28 septembre 2026 : Gemini 2.5 Pro (Mar 2025) (85,9 %). Notation, limites et classement des 48 modèles mesurés.

Page : https://quelleia.com/benchmarks/livebench_code/
Source du benchmark : https://livebench.ai
Mainteneur : LiveBench (Abacus.AI, NYU et coauteurs)
Tâche : Code
État : archivé

## À quoi il sert

LiveBench, code servait à noter la tâche Code. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

## Comment c'est noté

La part d'exercices dont le code passe les tests.

## Ce qu'il ne dit pas

Des exercices courts, éloignés du travail sur un vrai projet. Dernière édition en juin 2026.

## Qui le tient

LiveBench (Abacus.AI, NYU et coauteurs).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 54. Le meilleur, Gemini 2.5 Pro (Mar 2025), atteint 85,9 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 45 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 83 %
- Score IA 100 (niveau de Claude Opus 5.5) : 96 %

## Son poids dans le score IA

0 % du score général. LiveBench, code est archivé et ne compte plus : la tâche Code (15 % du score général) repose sur 13 autres benchmarks.

## Classement (48 modèles mesurés · 54 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Gemini 2.5 Pro (Mar 2025)](https://quelleia.com/modeles/gemini-2-5-pro-mar-2025.md) | Google DeepMind | non précisée | 85,9 % | 79,2 | https://epoch.ai/benchmarks |
| 2 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 82,7 % | 75,9 | https://epoch.ai/benchmarks |
| 3 | [GPT-4.5](https://quelleia.com/modeles/gpt-4-5.md) | OpenAI | non précisée | 75,2 % | 69,4 | https://epoch.ai/benchmarks |
| 4 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | non précisée | 74,5 % | 69,0 | https://epoch.ai/benchmarks |
| 5 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Élevée | 72,5 % | 67,5 | https://epoch.ai/benchmarks |
| 6 | [QwQ-32B](https://quelleia.com/modeles/qwq-32b.md) | Alibaba | non précisée | 72,2 % | 67,3 | https://epoch.ai/benchmarks |
| 7 | [DeepSeek-V3 (Mar 2025)](https://quelleia.com/modeles/deepseek-v3-mar-2025.md) | DeepSeek | non précisée | 70,9 % | 66,4 | https://epoch.ai/benchmarks |
| 8 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Élevée | 69,7 % | 65,6 | https://epoch.ai/benchmarks |
| 9 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 67,1 % | 63,9 | https://epoch.ai/benchmarks |
| 10 | [DeepSeek-R1](https://quelleia.com/modeles/deepseek-r1.md) | DeepSeek | non précisée | 66,7 % | 63,6 | https://epoch.ai/benchmarks |
| 11 | [Qwen2.5-Max](https://quelleia.com/modeles/qwen2-5-max.md) | Alibaba | non précisée | 64,4 % | 62,2 | https://epoch.ai/benchmarks |
| 12 | [Gemini 2.0 Pro](https://quelleia.com/modeles/gemini-2-0-pro.md) | Google DeepMind | non précisée | 63,5 % | 61,6 | https://epoch.ai/benchmarks |
| 13 | [Gemini 2.0 Flash (Dec 2024)](https://quelleia.com/modeles/gemini-2-0-flash-dec-2024.md) | Google DeepMind | non précisée | 63,4 % | 61,6 | https://epoch.ai/benchmarks |
| 14 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 61,8 % | 60,6 | https://epoch.ai/benchmarks |
| 15 | [Dracarys2-72B-Instruct](https://quelleia.com/modeles/dracarys2-72b-instruct.md) |  | non précisée | 58,9 % | 58,9 | https://epoch.ai/benchmarks |
| 16 | [Qwen2.5-Coder-32B-Instruct](https://quelleia.com/modeles/qwen2-5-coder-32b-instruct.md) | Alibaba | non précisée | 56,9 % | 57,7 | https://epoch.ai/benchmarks |
| 17 | [Gemini 2.0 Flash (Feb 2025)](https://quelleia.com/modeles/gemini-2-0-flash-feb-2025.md) | Google DeepMind | non précisée | 53,9 % | 56,0 | https://epoch.ai/benchmarks |
| 18 | [Gemini 2.0 Flash Thinking (Jan 2025)](https://quelleia.com/modeles/gemini-2-0-flash-thinking-jan-2025.md) | Google DeepMind | non précisée | 53,5 % | 55,8 | https://epoch.ai/benchmarks |
| 19 | [DeepSeek-R1-Distill-Llama-70B](https://quelleia.com/modeles/deepseek-r1-distill-llama-70b.md) | DeepSeek | non précisée | 51,6 % | 54,7 | https://epoch.ai/benchmarks |
| 20 | [GPT-4o (Aug 2024)](https://quelleia.com/modeles/gpt-4o-aug-2024.md) | OpenAI | non précisée | 51,4 % | 54,6 | https://epoch.ai/benchmarks |
| 21 | [Claude 3.5 Haiku](https://quelleia.com/modeles/claude-3-5-haiku.md) | Anthropic | non précisée | 51,4 % | 54,6 | https://epoch.ai/benchmarks |
| 22 | [o1-mini](https://quelleia.com/modeles/o1-mini.md) | OpenAI | Moyenne | 48,1 % | 52,7 | https://epoch.ai/benchmarks |
| 23 | [Gemini 2.0 Flash-Lite](https://quelleia.com/modeles/gemini-2-0-flash-lite.md) | Google DeepMind | non précisée | 47,1 % | 52,2 | https://epoch.ai/benchmarks |
| 23 | [Mistral Large 2 (Nov 2024)](https://quelleia.com/modeles/mistral-large-2-nov-2024.md) | Mistral AI | non précisée | 47,1 % | 52,2 | https://epoch.ai/benchmarks |
| 25 | [learnlm-1.5-pro-experimental](https://quelleia.com/modeles/learnlm-1-5-pro-experimental.md) | Google DeepMind | non précisée | 46,9 % | 52,1 | https://epoch.ai/benchmarks |
| 26 | [Grok-2 (Dec 2024)](https://quelleia.com/modeles/grok-2-dec-2024.md) | xAI | non précisée | 46,4 % | 51,8 | https://epoch.ai/benchmarks |
| 27 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 46,1 % | 51,6 | https://epoch.ai/benchmarks |
| 28 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 43,2 % | 50,0 | https://epoch.ai/benchmarks |
| 29 | [Gemma 3 27B](https://quelleia.com/modeles/gemma-3-27b.md) | Google DeepMind | non précisée | 39,9 % | 48,1 | https://epoch.ai/benchmarks |
| 30 | [Claude 3 Opus](https://quelleia.com/modeles/claude-3-opus.md) | Anthropic | non précisée | 38,6 % | 47,3 | https://epoch.ai/benchmarks |
| 31 | [Amazon Nova Pro](https://quelleia.com/modeles/amazon-nova-pro.md) | Amazon | non précisée | 38,2 % | 47,0 | https://epoch.ai/benchmarks |
| 32 | [QwQ-32B-Preview](https://quelleia.com/modeles/qwq-32b-preview.md) | Alibaba | non précisée | 37,2 % | 46,5 | https://epoch.ai/benchmarks |
| 33 | [Llama 3.3 70B](https://quelleia.com/modeles/llama-3-3-70b.md) | Meta AI | non précisée | 36,6 % | 46,1 | https://epoch.ai/benchmarks |
| 34 | [Dracarys2-Llama-3.1-70B-Instruct](https://quelleia.com/modeles/dracarys2-llama-3-1-70b-instruct.md) |  | non précisée | 36,3 % | 45,9 | https://epoch.ai/benchmarks |
| 35 | [Mistral Small 3.1](https://quelleia.com/modeles/mistral-small-3-1.md) | Mistral AI | non précisée | 36,2 % | 45,9 | https://epoch.ai/benchmarks |
| 36 | [Gemma 2 27B](https://quelleia.com/modeles/gemma-2-27b.md) | Google DeepMind | non précisée | 36 % | 45,7 | https://epoch.ai/benchmarks |
| 37 | [Mistral Small 3](https://quelleia.com/modeles/mistral-small-3.md) | Mistral AI | non précisée | 35,3 % | 45,3 | https://epoch.ai/benchmarks |
| 38 | [sonar](https://quelleia.com/modeles/sonar.md) | Perplexity | non précisée | 35,2 % | 45,2 | https://epoch.ai/benchmarks |
| 39 | [DeepSeek-R1-Distill-Qwen-32B](https://quelleia.com/modeles/deepseek-r1-distill-qwen-32b.md) | DeepSeek | non précisée | 33,7 % | 44,3 | https://epoch.ai/benchmarks |
| 40 | [Phi-4](https://quelleia.com/modeles/phi-4.md) | Microsoft | non précisée | 30,7 % | 42,4 | https://epoch.ai/benchmarks |
| 41 | [Amazon Nova Lite](https://quelleia.com/modeles/amazon-nova-lite.md) | Amazon | non précisée | 27,5 % | 40,2 | https://epoch.ai/benchmarks |
| 42 | [Gemma 2 9B](https://quelleia.com/modeles/gemma-2-9b.md) | Google DeepMind | non précisée | 22,5 % | 36,4 | https://epoch.ai/benchmarks |
| 43 | [phi-3-small 7.4B](https://quelleia.com/modeles/phi-3-small-7-4b.md) | Microsoft | non précisée | 20,3 % | 34,6 | https://epoch.ai/benchmarks |
| 44 | [Amazon Nova Micro](https://quelleia.com/modeles/amazon-nova-micro.md) | Amazon | non précisée | 20,2 % | 34,5 | https://epoch.ai/benchmarks |
| 45 | [Command R+](https://quelleia.com/modeles/command-r.md) | Cohere | non précisée | 19,1 % | 33,6 | https://epoch.ai/benchmarks |
| 46 | [c4ai-command-r-08-2024](https://quelleia.com/modeles/c4ai-command-r-08-2024.md) | Cohere | non précisée | 17,9 % | 32,4 | https://epoch.ai/benchmarks |
| 47 | [phi-3-mini 3.8B](https://quelleia.com/modeles/phi-3-mini-3-8b.md) | Microsoft | non précisée | 15,5 % | 30,0 | https://epoch.ai/benchmarks |
| 48 | [OLMo 2 Furious 13B](https://quelleia.com/modeles/olmo-2-furious-13b.md) | Allen Institute for AI | non précisée | 10,4 % | 23,5 | https://epoch.ai/benchmarks |

## En bref

**Que mesure LiveBench, code ?** Des exercices de programmation récents, tirés de concours publiés après la sortie des modèles. Sur Quelle IA, il est rangé dans la tâche Code.

**Comment LiveBench, code est-il noté ?** La part d'exercices dont le code passe les tests. Un modèle qui obtient 50 % a un score IA d'environ 54.

**Qui est en tête sur LiveBench, code ?** Gemini 2.5 Pro (Mar 2025) (Google DeepMind) est en tête de LiveBench, code avec 85,9 %, dans l'édition du 28 septembre 2026. Suivent o3-mini (82,7 %) et GPT-4.5 (75,2 %). 48 modèles y sont mesurés.

**Quelles sont les limites de LiveBench, code ?** Des exercices courts, éloignés du travail sur un vrai projet. Dernière édition en juin 2026. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse LiveBench, code dans le score IA ?** LiveBench, code compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Code (15 % du score général) repose sur 13 autres benchmarks.

**Qui maintient LiveBench, code ?** LiveBench (Abacus.AI, NYU et coauteurs). Sa page de référence : livebench.ai.

## Les autres benchmarks de la tâche Code

- [Arena, questions de code](https://quelleia.com/benchmarks/arena_code.md) : 275 modèles · 1,15 % du score
- [WeirdML (v2)](https://quelleia.com/benchmarks/weirdml.md) : 129 modèles · 1,15 % du score
- [SciCode](https://quelleia.com/benchmarks/scicode.md) : 120 modèles · 1,15 % du score
- [Terminal-Bench 2.0](https://quelleia.com/benchmarks/terminal_bench.md) : 45 modèles · 1,15 % du score
- [FrontierCode](https://quelleia.com/benchmarks/frontiercode.md) : 37 modèles · 1,15 % du score
- [SWE-bench Verified](https://quelleia.com/benchmarks/swe_bench_verified.md) : 32 modèles · 1,15 % du score
- [DeepSWE](https://quelleia.com/benchmarks/deepswe.md) : 26 modèles · 1,15 % du score
- [GSO](https://quelleia.com/benchmarks/gso_bench.md) : 26 modèles · 1,15 % du score
- [GBAEval](https://quelleia.com/benchmarks/gbaeval.md) : 23 modèles · 1,15 % du score
- [FrontierSWE](https://quelleia.com/benchmarks/frontierswe.md) : 16 modèles · 1,15 % du score
- [CursorBench](https://quelleia.com/benchmarks/cursorbench.md) : 13 modèles · 1,15 % du score
- [WeirdML v3](https://quelleia.com/benchmarks/weirdml_v3.md) : 11 modèles · 1,15 % du score
- [MirrorCode](https://quelleia.com/benchmarks/mirrorcode.md) : 9 modèles · 1,15 % du score
- [Aider Polyglot](https://quelleia.com/benchmarks/aider_polyglot.md) : 54 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
