Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

MathsFiche benchmark · Epoch AI pour l'évaluation ; jeu MATH de Hendrycks et al. (2021) · epoch.ai

MATH Level 5

Les 1 324 problèmes les plus durs du jeu MATH, tirés de concours de lycée américains comme l'AMC et l'AIME.

ARCHIVÉ

À quoi il sert

MATH Level 5 servait à noter la tâche Mathématiques. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

Comment c'est noté

Part de réponses finales justes ; l'équivalence avec la solution attendue est jugée par un modèle correcteur.

Ce qu'il ne dit pas

Jeu public depuis 2021, donc probablement vu à l'entraînement. Les meilleurs modèles dépassent 98 % : le test ne départage plus le haut du classement.

Comment lire le score

94 modèles mesurés · 108 mesures

En tête : GPT-5, 98,1 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 49. Le meilleur, GPT-5, atteint 98,1 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
56 %
Score IA 76niveau de Claude Sonnet 4.5
97 %
Score IA 100niveau de Claude Opus 5.5
plus de 99 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. MATH Level 5 est archivé et ne compte plus : la tâche Mathématiques (10 % du score général) repose sur 8 autres benchmarks.

En couleur, la tâche Mathématiques dans le score général. MATH Level 5 n'y a plus de part.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-5OpenAI · 2 configurationsÉlevée98,1 %80,6
2GPT-5 miniOpenAI · 2 configurationsÉlevée97,8 %79,4
3o4-miniOpenAIÉlevée97,8 %79,4
4o3OpenAIÉlevée97,8 %79,2
5Claude Sonnet 4.5AnthropicBudget97,7 %79,0
6Qwen3-MaxAlibabaNon précisée97,1 %77,1
7DeepSeek-R1 (May 2025)DeepSeek · poids ouvertsNon précisée96,6 %75,8
8o3-miniOpenAI · 2 configurationsÉlevée96,5 %75,4
9Claude Haiku 4.5Anthropic · 2 configurationsBudget96,4 %75,1
10Gemini 2.5 Pro (May 2025)Google DeepMindNon précisée95,9 %74,2
94 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 94 →Replier le classement ↑
11Gemini 2.5 Pro (Mar 2025)Google DeepMindNon précisée95,6 %73,5
12GPT-5 nanoOpenAI · 2 configurationsMoyenne95,2 %72,9
13o1OpenAI · 2 configurationsÉlevée94,7 %72,0
14DeepSeek-R1DeepSeek · poids ouvertsNon précisée93,1 %69,7
15Claude 3.7 SonnetAnthropic · 4 configurationsBudget91,2 %67,6
16Grok-3 minixAI · 2 configurationsFaible90,9 %67,4
17DeepSeek-R1-Distill-Llama-70BDeepSeek · poids ouvertsNon précisée89,9 %66,5
18o1-miniOpenAI · 2 configurationsÉlevée89,2 %65,9
19Grok 3xAINon précisée88,7 %65,5
20GPT-4.1 miniOpenAINon précisée87,3 %64,4
21DeepSeek-R1-Distill-Qwen-14BDeepSeekNon précisée87,1 %64,3
22Claude Opus 4AnthropicNon précisée85 %62,9
23Claude Sonnet 4AnthropicNon précisée84,4 %62,5
24Gemini 2.0 ProGoogle DeepMindNon précisée83,5 %61,9
25GPT-4.1OpenAINon précisée83 %61,7
26Gemini 2.0 Flash (Feb 2025)Google DeepMindNon précisée82,2 %61,2
27o1-previewOpenAINon précisée81,6 %60,9
28Mistral Medium 3Mistral AINon précisée81,6 %60,9
29GPT-4.5OpenAINon précisée78,6 %59,4
30DeepSeek-V3 (Mar 2025)DeepSeek · poids ouvertsNon précisée75,5 %58,0
31Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée74 %57,4
32Llama 4 MaverickMeta AI · poids ouvertsNon précisée73 %57,0
33Gemini 1.5 Pro (Sept 2024)Google DeepMindNon précisée70,4 %56,0
34GPT-4.1 nanoOpenAINon précisée70 %55,8
35Qwen3-235B-A22BAlibaba · poids ouvertsNon précisée68,9 %55,4
36Qwen2.5-MaxAlibabaNon précisée67,2 %54,8
37Qwen Plus (Jan 2025)AlibabaNon précisée65,3 %54,1
38Phi-4Microsoft · poids ouvertsNon précisée64,9 %54,0
39DeepSeek-V3DeepSeek · poids ouvertsNon précisée64,9 %53,9
40Grok-2 (Dec 2024)xAINon précisée63,5 %53,5
41Qwen2.5-72BAlibaba · poids ouvertsNon précisée63,2 %53,4
42Llama 4 ScoutMeta AI · poids ouvertsNon précisée62,3 %53,1
43Gemini 1.5 Flash (Sep 2024)Google DeepMindNon précisée61,9 %52,9
44Claude 3.5 Sonnet (October 2024)AnthropicNon précisée56,9 %51,3
45Qwen-TurboAlibabaNon précisée56,2 %51,1
46Qwen2.5-32BAlibaba · poids ouvertsNon précisée56,1 %51,0
47GPT-4o (Aug 2024)OpenAINon précisée53,3 %50,1
48GPT-4o miniOpenAINon précisée52,6 %49,9
49Claude 3.5 SonnetAnthropicNon précisée51,7 %49,6
50GPT-4o (May 2024)OpenAINon précisée51 %49,4
51Mistral Large 2 (Nov 2024)Mistral AI · poids ouvertsNon précisée50,3 %49,2
52Llama 3.1-405BMeta AI · poids ouvertsNon précisée49,8 %49,0
52GPT-4o (Nov 2024)OpenAINon précisée49,8 %49,0
54Mistral Small 3.1Mistral AINon précisée46,8 %48,0
55GPT-4 Turbo (Apr 2024)OpenAINon précisée46,7 %48,0
56Claude 3.5 HaikuAnthropicNon précisée46,4 %47,9
57Mistral Large 2 (Jul 2024)Mistral AINon précisée44,8 %47,4
57Mistral Small 3Mistral AINon précisée44,8 %47,4
59Tulu 3 (Tülu 3) 70BAllen Institute for AI · poids ouvertsNon précisée42,7 %46,7
60Llama 3.3 70BMeta AI · poids ouvertsNon précisée41,6 %46,4
61Gemini 1.5 Pro (May 2024)Google DeepMindNon précisée40,7 %46,1
62GPT-4 Turbo (Nov 2023)OpenAI · 2 configurationsNon précisée40 %45,8
63Llama 3.2 90BMeta AI · poids ouvertsNon précisée39,4 %45,6
64Qwen2-72BAlibaba · poids ouvertsNon précisée39,1 %45,5
65Claude 3 OpusAnthropicNon précisée37,5 %45,0
66Llama 3.1-70BMeta AI · poids ouvertsNon précisée36,7 %44,7
67Gemma 2 27BGoogle DeepMindNon précisée27,9 %41,5
68WizardLM-2 8x22BMicrosoftNon précisée25,7 %40,6
69Yi-1.5-34B01.AI · poids ouvertsNon précisée25,5 %40,5
70Gemini 1.5 Flash (May 2024)Google DeepMindNon précisée25,1 %40,4
71Mistral LargeMistral AI · poids ouvertsNon précisée24,5 %40,1
72Mixtral 8x22BMistral AI · poids ouvertsNon précisée24,2 %40,0
73GPT-4 (Jun 2023)OpenAINon précisée23 %39,4
74Llama 3.1-8BMeta AI · poids ouvertsNon précisée22,9 %39,4
75Hermes 2 Theta Llama-3 70BNous Research · poids ouvertsNon précisée22,7 %39,3
76Llama 3-70BMeta AI · poids ouvertsNon précisée22,6 %39,2
77Gemma 2 9BGoogle DeepMind · poids ouvertsNon précisée21 %38,5
78Claude 3 SonnetAnthropicNon précisée18,2 %37,1
79phi-3-medium 14BMicrosoft · poids ouvertsNon précisée17,6 %36,8
80GPT-3.5 Turbo (Nov 2023)OpenAINon précisée15,9 %35,8
81Ministral 8BMistral AI · poids ouvertsNon précisée14,9 %35,2
82Claude 3 HaikuAnthropicNon précisée14,9 %35,2
83Ministral 3BMistral AI · poids ouvertsNon précisée14,4 %34,9
84Claude 2AnthropicNon précisée11,7 %33,0
85DBRXDatabricks · poids ouvertsNon précisée11,7 %32,9
86GPT-3.5 Turbo (Jan 2024)OpenAINon précisée11,6 %32,9
87Gemini 1.0 ProGoogle DeepMindNon précisée11,2 %32,6
88Mistral NeMoMistral AI · poids ouvertsNon précisée10,8 %32,3
89Mixtral 8x7BMistral AI · poids ouverts · 2 configurationsNon précisée10 %31,5
90DeepSeek LLM 67BDeepSeek · poids ouvertsNon précisée6,4 %27,7
91Llama 3-8BMeta AI · poids ouvertsNon précisée6,1 %27,3
92Yi-34B01.AI · poids ouvertsNon précisée5,1 %25,9
93Mistral 7B v0.3Mistral AI · poids ouverts · 2 configurationsNon précisée3,7 %23,1
94Llama 2-70BMeta AI · poids ouvertsNon précisée3,3 %22,1

En bref

Que mesure MATH Level 5 ?
Les 1 324 problèmes les plus durs du jeu MATH, tirés de concours de lycée américains comme l'AMC et l'AIME. Sur Quelle IA, il est rangé dans la tâche Mathématiques.
Comment MATH Level 5 est-il noté ?
Part de réponses finales justes ; l'équivalence avec la solution attendue est jugée par un modèle correcteur. Un modèle qui obtient 50 % a un score IA d'environ 49.
Qui est en tête sur MATH Level 5 ?
GPT-5 (OpenAI) est en tête de MATH Level 5 avec 98,1 %, dans l'édition du 28 septembre 2026. Suivent GPT-5 mini (97,8 %) et o4-mini (97,8 %). 94 modèles y sont mesurés.
Quelles sont les limites de MATH Level 5 ?
Jeu public depuis 2021, donc probablement vu à l'entraînement. Les meilleurs modèles dépassent 98 % : le test ne départage plus le haut du classement. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse MATH Level 5 dans le score IA ?
MATH Level 5 compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Mathématiques (10 % du score général) repose sur 8 autres benchmarks.
Qui maintient MATH Level 5 ?
Epoch AI pour l'évaluation ; jeu MATH de Hendrycks et al. (2021). Sa page de référence : epoch.ai/benchmarks/math-level-5.

Les autres benchmarks de la tâche Mathématiques

Tous les benchmarks →Comment le score IA est calculé →