Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Test historiqueFiche benchmark · Équipe LiveBench (White et al., Abacus.AI) · livebench.ai

LiveBench

Un test généraliste aux questions renouvelées régulièrement : raisonnement, code, maths, analyse de données, langue et respect des consignes.

ARCHIVÉ

À quoi il sert

LiveBench est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

Comment c'est noté

Moyenne sur 100 des catégories ; chaque question a une réponse objective, corrigée automatiquement sans IA correctrice.

Ce qu'il ne dit pas

Les données d'Epoch sont figées sur le jeu de questions de novembre 2024 et ne contiennent aucun modèle sorti après novembre 2025.

Qui le tient

Équipe LiveBench (White et al., Abacus.AI).

livebench.ai · test historique · 48 modèles mesurés

Comment lire le score

48 modèles mesurés · 54 mesures

En tête : Gemini 2.5 Pro (Mar 2025), 82,4 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 51. Le meilleur, Gemini 2.5 Pro (Mar 2025), atteint 82,4 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
50 %
Score IA 76niveau de Claude Sonnet 4.5
82 %
Score IA 100niveau de Claude Opus 5.5
95 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. LiveBench est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Gemini 2.5 Pro (Mar 2025)Google DeepMindNon précisée82,4 %77,0
2GPT-5.1OpenAIÉlevée78,8 %73,1
3Claude 3.7 SonnetAnthropic · 2 configurationsNon précisée76,1 %70,5
4o3-miniOpenAI · 3 configurationsÉlevée75,9 %70,3
5o1OpenAIÉlevée75,7 %70,1
6QwQ-32BAlibaba · poids ouvertsNon précisée72 %66,9
7DeepSeek-R1DeepSeek · poids ouvertsNon précisée71,6 %66,6
8GPT-4.5OpenAINon précisée69 %64,5
9Gemini 2.0 Flash Thinking (Jan 2025)Google DeepMindNon précisée66,9 %62,9
10DeepSeek-V3 (Mar 2025)DeepSeek · poids ouvertsNon précisée66,9 %62,9
48 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 48 →Replier le classement ↑
11Gemini 2.0 ProGoogle DeepMindNon précisée65,1 %61,6
12Gemini 2.0 Flash (Dec 2024)Google DeepMind · 2 configurationsNon précisée64,1 %60,8
13Qwen2.5-MaxAlibabaNon précisée62,3 %59,5
14Gemini 2.0 Flash (Feb 2025)Google DeepMindNon précisée61,5 %58,9
15DeepSeek-V3DeepSeek · poids ouvertsNon précisée60,5 %58,2
16Claude 3.5 Sonnet (October 2024)AnthropicNon précisée59 %57,2
17o1-miniOpenAIMoyenne57,8 %56,3
18GPT-4o (Aug 2024)OpenAINon précisée55,3 %54,7
19DeepSeek-R1-Distill-Llama-70BDeepSeek · poids ouvertsNon précisée54,5 %54,1
20Grok-2 (Dec 2024)xAINon précisée54,3 %54,0
21Gemini 2.0 Flash-LiteGoogle DeepMind · 2 configurationsNon précisée54,3 %54,0
22Dracarys2-72B-InstructNon précisée52,6 %52,9
23learnlm-1.5-pro-experimentalGoogle DeepMindNon précisée52,2 %52,6
23GPT-4o (Nov 2024)OpenAINon précisée52,2 %52,6
25Llama 3.3 70BMeta AI · poids ouvertsNon précisée50,2 %51,2
26Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée50 %51,1
27Claude 3 OpusAnthropicNon précisée49,2 %50,5
28Mistral Large 2 (Nov 2024)Mistral AI · poids ouvertsNon précisée48,4 %50,0
29sonarPerplexityNon précisée46,9 %49,0
30Qwen2.5-Coder-32B-InstructAlibaba · poids ouvertsNon précisée46,2 %48,5
31Dracarys2-Llama-3.1-70B-InstructNon précisée46,2 %48,5
32DeepSeek-R1-Distill-Qwen-32BDeepSeekNon précisée45,6 %48,1
33Mistral Small 3.1Mistral AINon précisée44 %47,0
34Amazon Nova ProAmazonNon précisée43,5 %46,7
35Claude 3.5 HaikuAnthropicNon précisée43,5 %46,7
36Mistral Small 3Mistral AINon précisée42,6 %46,0
37Phi-4Microsoft · poids ouvertsNon précisée41,6 %45,4
38GPT-4o miniOpenAINon précisée41,3 %45,2
39QwQ-32B-PreviewAlibaba · poids ouvertsNon précisée40,3 %44,4
40Gemma 2 27BGoogle DeepMindNon précisée38,2 %43,0
41Amazon Nova LiteAmazonNon précisée36,4 %41,7
42Command R+Cohere · poids ouvertsNon précisée31,8 %38,2
43Amazon Nova MicroAmazonNon précisée29,6 %36,5
44Gemma 2 9BGoogle DeepMind · poids ouvertsNon précisée28,7 %35,8
45c4ai-command-r-08-2024Cohere · poids ouvertsNon précisée27,5 %34,8
46phi-3-small 7.4BMicrosoft · poids ouvertsNon précisée24 %31,8
47phi-3-mini 3.8BMicrosoft · poids ouverts · 2 configurationsNon précisée22,4 %30,2
48OLMo 2 Furious 13BAllen Institute for AI · poids ouvertsNon précisée22,1 %29,9

En bref

Que mesure LiveBench ?
Un test généraliste aux questions renouvelées régulièrement : raisonnement, code, maths, analyse de données, langue et respect des consignes. C'est un test historique, hors des scores d'aujourd'hui.
Comment LiveBench est-il noté ?
Moyenne sur 100 des catégories ; chaque question a une réponse objective, corrigée automatiquement sans IA correctrice. Un modèle qui obtient 50 % a un score IA d'environ 51.
Qui est en tête sur LiveBench ?
Gemini 2.5 Pro (Mar 2025) (Google DeepMind) est en tête de LiveBench avec 82,4 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.1 (78,8 %) et Claude 3.7 Sonnet (76,1 %). 48 modèles y sont mesurés.
Quelles sont les limites de LiveBench ?
Les données d'Epoch sont figées sur le jeu de questions de novembre 2024 et ne contiennent aucun modèle sorti après novembre 2025. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse LiveBench dans le score IA ?
LiveBench compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.
Qui maintient LiveBench ?
Équipe LiveBench (White et al., Abacus.AI). Sa page de référence : livebench.ai.

Les autres tests historiques

Tous les benchmarks →Comment le score IA est calculé →