Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

CodeFiche benchmark · LiveBench (Abacus.AI, NYU et coauteurs) · livebench.ai

LiveBench, code

Des exercices de programmation récents, tirés de concours publiés après la sortie des modèles.

ARCHIVÉ

À quoi il sert

LiveBench, code servait à noter la tâche Code. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

Comment c'est noté

La part d'exercices dont le code passe les tests.

Ce qu'il ne dit pas

Des exercices courts, éloignés du travail sur un vrai projet. Dernière édition en juin 2026.

Qui le tient

LiveBench (Abacus.AI, NYU et coauteurs).

livebench.ai · tâche Code · 48 modèles mesurés

Comment lire le score

48 modèles mesurés · 54 mesures

En tête : Gemini 2.5 Pro (Mar 2025), 85,9 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 54. Le meilleur, Gemini 2.5 Pro (Mar 2025), atteint 85,9 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
45 %
Score IA 76niveau de Claude Sonnet 4.5
83 %
Score IA 100niveau de Claude Opus 5.5
96 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. LiveBench, code est archivé et ne compte plus : la tâche Code (15 % du score général) repose sur 13 autres benchmarks.

En couleur, la tâche Code dans le score général. LiveBench, code n'y a plus de part.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Gemini 2.5 Pro (Mar 2025)Google DeepMindNon précisée85,9 %79,2
2o3-miniOpenAI · 3 configurationsÉlevée82,7 %75,9
3GPT-4.5OpenAINon précisée75,2 %69,4
4Claude 3.7 SonnetAnthropic · 2 configurationsNon précisée74,5 %69,0
5GPT-5.1OpenAIÉlevée72,5 %67,5
6QwQ-32BAlibaba · poids ouvertsNon précisée72,2 %67,3
7DeepSeek-V3 (Mar 2025)DeepSeek · poids ouvertsNon précisée70,9 %66,4
8o1OpenAIÉlevée69,7 %65,6
9Claude 3.5 Sonnet (October 2024)AnthropicNon précisée67,1 %63,9
10DeepSeek-R1DeepSeek · poids ouvertsNon précisée66,7 %63,6
48 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 48 →Replier le classement ↑
11Qwen2.5-MaxAlibabaNon précisée64,4 %62,2
12Gemini 2.0 ProGoogle DeepMindNon précisée63,5 %61,6
13Gemini 2.0 Flash (Dec 2024)Google DeepMind · 2 configurationsNon précisée63,4 %61,6
14DeepSeek-V3DeepSeek · poids ouvertsNon précisée61,8 %60,6
15Dracarys2-72B-InstructNon précisée58,9 %58,9
16Qwen2.5-Coder-32B-InstructAlibaba · poids ouvertsNon précisée56,9 %57,7
17Gemini 2.0 Flash (Feb 2025)Google DeepMindNon précisée53,9 %56,0
18Gemini 2.0 Flash Thinking (Jan 2025)Google DeepMindNon précisée53,5 %55,8
19DeepSeek-R1-Distill-Llama-70BDeepSeek · poids ouvertsNon précisée51,6 %54,7
20GPT-4o (Aug 2024)OpenAINon précisée51,4 %54,6
21Claude 3.5 HaikuAnthropicNon précisée51,4 %54,6
22o1-miniOpenAIMoyenne48,1 %52,7
23Gemini 2.0 Flash-LiteGoogle DeepMind · 2 configurationsNon précisée47,1 %52,2
23Mistral Large 2 (Nov 2024)Mistral AI · poids ouvertsNon précisée47,1 %52,2
25learnlm-1.5-pro-experimentalGoogle DeepMindNon précisée46,9 %52,1
26Grok-2 (Dec 2024)xAINon précisée46,4 %51,8
27GPT-4o (Nov 2024)OpenAINon précisée46,1 %51,6
28GPT-4o miniOpenAINon précisée43,2 %50,0
29Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée39,9 %48,1
30Claude 3 OpusAnthropicNon précisée38,6 %47,3
31Amazon Nova ProAmazonNon précisée38,2 %47,0
32QwQ-32B-PreviewAlibaba · poids ouvertsNon précisée37,2 %46,5
33Llama 3.3 70BMeta AI · poids ouvertsNon précisée36,6 %46,1
34Dracarys2-Llama-3.1-70B-InstructNon précisée36,3 %45,9
35Mistral Small 3.1Mistral AINon précisée36,2 %45,9
36Gemma 2 27BGoogle DeepMindNon précisée36 %45,7
37Mistral Small 3Mistral AINon précisée35,3 %45,3
38sonarPerplexityNon précisée35,2 %45,2
39DeepSeek-R1-Distill-Qwen-32BDeepSeekNon précisée33,7 %44,3
40Phi-4Microsoft · poids ouvertsNon précisée30,7 %42,4
41Amazon Nova LiteAmazonNon précisée27,5 %40,2
42Gemma 2 9BGoogle DeepMind · poids ouvertsNon précisée22,5 %36,4
43phi-3-small 7.4BMicrosoft · poids ouvertsNon précisée20,3 %34,6
44Amazon Nova MicroAmazonNon précisée20,2 %34,5
45Command R+Cohere · poids ouvertsNon précisée19,1 %33,6
46c4ai-command-r-08-2024Cohere · poids ouvertsNon précisée17,9 %32,4
47phi-3-mini 3.8BMicrosoft · poids ouverts · 2 configurationsNon précisée15,5 %30,0
48OLMo 2 Furious 13BAllen Institute for AI · poids ouvertsNon précisée10,4 %23,5

En bref

Que mesure LiveBench, code ?
Des exercices de programmation récents, tirés de concours publiés après la sortie des modèles. Sur Quelle IA, il est rangé dans la tâche Code.
Comment LiveBench, code est-il noté ?
La part d'exercices dont le code passe les tests. Un modèle qui obtient 50 % a un score IA d'environ 54.
Qui est en tête sur LiveBench, code ?
Gemini 2.5 Pro (Mar 2025) (Google DeepMind) est en tête de LiveBench, code avec 85,9 %, dans l'édition du 28 septembre 2026. Suivent o3-mini (82,7 %) et GPT-4.5 (75,2 %). 48 modèles y sont mesurés.
Quelles sont les limites de LiveBench, code ?
Des exercices courts, éloignés du travail sur un vrai projet. Dernière édition en juin 2026. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse LiveBench, code dans le score IA ?
LiveBench, code compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Code (15 % du score général) repose sur 13 autres benchmarks.
Qui maintient LiveBench, code ?
LiveBench (Abacus.AI, NYU et coauteurs). Sa page de référence : livebench.ai.

Les autres benchmarks de la tâche Code

Tous les benchmarks →Comment le score IA est calculé →