Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

MathsFiche benchmark · LiveBench (Abacus.AI, NYU et coauteurs) · livebench.ai

LiveBench, mathématiques

Des problèmes de mathématiques récents, de niveau concours et olympiades.

ARCHIVÉ

À quoi il sert

LiveBench, mathématiques servait à noter la tâche Mathématiques. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

Comment c'est noté

La part de bonnes réponses, vérifiée automatiquement.

Ce qu'il ne dit pas

Juge la réponse finale, sans regarder la démonstration. Dernière édition en juin 2026.

Qui le tient

LiveBench (Abacus.AI, NYU et coauteurs).

livebench.ai · tâche Maths · 48 modèles mesurés

Comment lire le score

48 modèles mesurés · 54 mesures

En tête : GPT-5.1, 94,5 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 51. Le meilleur, GPT-5.1, atteint 94,5 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
49 %
Score IA 76niveau de Claude Sonnet 4.5
89 %
Score IA 100niveau de Claude Opus 5.5
98 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. LiveBench, mathématiques est archivé et ne compte plus : la tâche Mathématiques (10 % du score général) repose sur 8 autres benchmarks.

En couleur, la tâche Mathématiques dans le score général. LiveBench, mathématiques n'y a plus de part.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-5.1OpenAIÉlevée94,5 %85,5
2Gemini 2.5 Pro (Mar 2025)Google DeepMindNon précisée90,2 %78,1
3DeepSeek-R1DeepSeek · poids ouvertsNon précisée80,7 %68,6
4o1OpenAIÉlevée80,3 %68,3
5Claude 3.7 SonnetAnthropic · 2 configurationsNon précisée79 %67,4
6QwQ-32BAlibaba · poids ouvertsNon précisée77,8 %66,5
7o3-miniOpenAI · 3 configurationsÉlevée77,3 %66,2
8Gemini 2.0 Flash Thinking (Jan 2025)Google DeepMindNon précisée75,9 %65,2
9DeepSeek-V3 (Mar 2025)DeepSeek · poids ouvertsNon précisée73,5 %63,7
10Gemini 2.0 Flash (Dec 2024)Google DeepMind · 2 configurationsNon précisée72,4 %63,0
48 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 48 →Replier le classement ↑
11Gemini 2.0 ProGoogle DeepMindNon précisée71 %62,2
12GPT-4.5OpenAINon précisée69,3 %61,2
13Gemini 2.0 Flash (Feb 2025)Google DeepMindNon précisée65,6 %59,2
14o1-miniOpenAIMoyenne62 %57,3
15DeepSeek-V3DeepSeek · poids ouvertsNon précisée60,5 %56,6
16DeepSeek-R1-Distill-Qwen-32BDeepSeekNon précisée59,4 %56,0
17Qwen2.5-MaxAlibabaNon précisée58,4 %55,5
18QwQ-32B-PreviewAlibaba · poids ouvertsNon précisée58,3 %55,4
19DeepSeek-R1-Distill-Llama-70BDeepSeek · poids ouvertsNon précisée58,1 %55,4
20Gemini 2.0 Flash-LiteGoogle DeepMind · 2 configurationsNon précisée58,1 %55,4
21learnlm-1.5-pro-experimentalGoogle DeepMindNon précisée57,8 %55,2
22Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée55,4 %54,0
23Grok-2 (Dec 2024)xAINon précisée54,9 %53,8
24Dracarys2-72B-InstructNon précisée54,7 %53,7
25Claude 3.5 Sonnet (October 2024)AnthropicNon précisée52,3 %52,5
26GPT-4o (Aug 2024)OpenAINon précisée49,5 %51,2
27Qwen2.5-Coder-32B-InstructAlibaba · poids ouvertsNon précisée46,6 %49,8
28Claude 3 OpusAnthropicNon précisée43,6 %48,4
29GPT-4o (Nov 2024)OpenAINon précisée42,9 %48,0
30Mistral Large 2 (Nov 2024)Mistral AI · poids ouvertsNon précisée42,6 %47,8
31Llama 3.3 70BMeta AI · poids ouvertsNon précisée42,2 %47,7
32Phi-4Microsoft · poids ouvertsNon précisée42 %47,6
33sonarPerplexityNon précisée41,6 %47,4
34Dracarys2-Llama-3.1-70B-InstructNon précisée40,3 %46,7
35Mistral Small 3Mistral AINon précisée39,9 %46,5
36Mistral Small 3.1Mistral AINon précisée39,4 %46,3
37Amazon Nova ProAmazonNon précisée38 %45,6
38Amazon Nova LiteAmazonNon précisée36,7 %44,9
39GPT-4o miniOpenAINon précisée36,3 %44,7
40Claude 3.5 HaikuAnthropicNon précisée35,5 %44,3
41Amazon Nova MicroAmazonNon précisée34,5 %43,7
42Gemma 2 27BGoogle DeepMindNon précisée26,5 %39,2
43Command R+Cohere · poids ouvertsNon précisée21,3 %35,7
44Gemma 2 9BGoogle DeepMind · poids ouvertsNon précisée19,8 %34,6
45c4ai-command-r-08-2024Cohere · poids ouvertsNon précisée19,4 %34,3
46phi-3-small 7.4BMicrosoft · poids ouvertsNon précisée17,6 %32,9
47phi-3-mini 3.8BMicrosoft · poids ouverts · 2 configurationsNon précisée15,7 %31,3
48OLMo 2 Furious 13BAllen Institute for AI · poids ouvertsNon précisée13,6 %29,3

En bref

Que mesure LiveBench, mathématiques ?
Des problèmes de mathématiques récents, de niveau concours et olympiades. Sur Quelle IA, il est rangé dans la tâche Mathématiques.
Comment LiveBench, mathématiques est-il noté ?
La part de bonnes réponses, vérifiée automatiquement. Un modèle qui obtient 50 % a un score IA d'environ 51.
Qui est en tête sur LiveBench, mathématiques ?
GPT-5.1 (OpenAI) est en tête de LiveBench, mathématiques avec 94,5 %, dans l'édition du 28 septembre 2026. Suivent Gemini 2.5 Pro (Mar 2025) (90,2 %) et DeepSeek-R1 (80,7 %). 48 modèles y sont mesurés.
Quelles sont les limites de LiveBench, mathématiques ?
Juge la réponse finale, sans regarder la démonstration. Dernière édition en juin 2026. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse LiveBench, mathématiques dans le score IA ?
LiveBench, mathématiques compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Mathématiques (10 % du score général) repose sur 8 autres benchmarks.
Qui maintient LiveBench, mathématiques ?
LiveBench (Abacus.AI, NYU et coauteurs). Sa page de référence : livebench.ai.

Les autres benchmarks de la tâche Mathématiques

Tous les benchmarks →Comment le score IA est calculé →