# MATH Level 5

> Fiche du benchmark MATH Level 5 sur Quelle IA, édition du 28 septembre 2026. Les 1 324 problèmes les plus durs du jeu MATH, tirés de concours de lycée américains comme l'AMC et l'AIME. En tête au 28 septembre 2026 : GPT-5 (98,1 %). Notation, limites et classement des 94 modèles mesurés.

Page : https://quelleia.com/benchmarks/math_level_5/
Source du benchmark : https://epoch.ai/benchmarks/math-level-5
Mainteneur : Epoch AI pour l'évaluation ; jeu MATH de Hendrycks et al. (2021)
Tâche : Mathématiques
État : archivé

## À quoi il sert

MATH Level 5 servait à noter la tâche Mathématiques. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

## Comment c'est noté

Part de réponses finales justes ; l'équivalence avec la solution attendue est jugée par un modèle correcteur.

## Ce qu'il ne dit pas

Jeu public depuis 2021, donc probablement vu à l'entraînement. Les meilleurs modèles dépassent 98 % : le test ne départage plus le haut du classement.

## Qui le tient

Epoch AI pour l'évaluation ; jeu MATH de Hendrycks et al. (2021).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 49. Le meilleur, GPT-5, atteint 98,1 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 56 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 97 %
- Score IA 100 (niveau de Claude Opus 5.5) : plus de 99 %

## Son poids dans le score IA

0 % du score général. MATH Level 5 est archivé et ne compte plus : la tâche Mathématiques (10 % du score général) repose sur 8 autres benchmarks.

## Classement (94 modèles mesurés · 108 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 98,1 % | 80,6 | https://epoch.ai/benchmarks |
| 2 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | Élevée | 97,8 % | 79,4 | https://epoch.ai/benchmarks |
| 3 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Élevée | 97,8 % | 79,4 | https://epoch.ai/benchmarks |
| 4 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Élevée | 97,8 % | 79,2 | https://epoch.ai/benchmarks |
| 5 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | Budget | 97,7 % | 79,0 | https://epoch.ai/benchmarks |
| 6 | [Qwen3-Max](https://quelleia.com/modeles/qwen3-max.md) | Alibaba | non précisée | 97,1 % | 77,1 | https://epoch.ai/benchmarks |
| 7 | [DeepSeek-R1 (May 2025)](https://quelleia.com/modeles/deepseek-r1-may-2025.md) | DeepSeek | non précisée | 96,6 % | 75,8 | https://epoch.ai/benchmarks |
| 8 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 96,5 % | 75,4 | https://epoch.ai/benchmarks |
| 9 | [Claude Haiku 4.5](https://quelleia.com/modeles/claude-haiku-4-5.md) | Anthropic | Budget | 96,4 % | 75,1 | https://epoch.ai/benchmarks |
| 10 | [Gemini 2.5 Pro (May 2025)](https://quelleia.com/modeles/gemini-2-5-pro-may-2025.md) | Google DeepMind | non précisée | 95,9 % | 74,2 | https://epoch.ai/benchmarks |
| 11 | [Gemini 2.5 Pro (Mar 2025)](https://quelleia.com/modeles/gemini-2-5-pro-mar-2025.md) | Google DeepMind | non précisée | 95,6 % | 73,5 | https://epoch.ai/benchmarks |
| 12 | [GPT-5 nano](https://quelleia.com/modeles/gpt-5-nano.md) | OpenAI | Moyenne | 95,2 % | 72,9 | https://epoch.ai/benchmarks |
| 13 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Élevée | 94,7 % | 72,0 | https://epoch.ai/benchmarks |
| 14 | [DeepSeek-R1](https://quelleia.com/modeles/deepseek-r1.md) | DeepSeek | non précisée | 93,1 % | 69,7 | https://epoch.ai/benchmarks |
| 15 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | Budget | 91,2 % | 67,6 | https://epoch.ai/benchmarks |
| 16 | [Grok-3 mini](https://quelleia.com/modeles/grok-3-mini.md) | xAI | Faible | 90,9 % | 67,4 | https://epoch.ai/benchmarks |
| 17 | [DeepSeek-R1-Distill-Llama-70B](https://quelleia.com/modeles/deepseek-r1-distill-llama-70b.md) | DeepSeek | non précisée | 89,9 % | 66,5 | https://epoch.ai/benchmarks |
| 18 | [o1-mini](https://quelleia.com/modeles/o1-mini.md) | OpenAI | Élevée | 89,2 % | 65,9 | https://epoch.ai/benchmarks |
| 19 | [Grok 3](https://quelleia.com/modeles/grok-3.md) | xAI | non précisée | 88,7 % | 65,5 | https://epoch.ai/benchmarks |
| 20 | [GPT-4.1 mini](https://quelleia.com/modeles/gpt-4-1-mini.md) | OpenAI | non précisée | 87,3 % | 64,4 | https://epoch.ai/benchmarks |
| 21 | [DeepSeek-R1-Distill-Qwen-14B](https://quelleia.com/modeles/deepseek-r1-distill-qwen-14b.md) | DeepSeek | non précisée | 87,1 % | 64,3 | https://epoch.ai/benchmarks |
| 22 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | non précisée | 85 % | 62,9 | https://epoch.ai/benchmarks |
| 23 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | non précisée | 84,4 % | 62,5 | https://epoch.ai/benchmarks |
| 24 | [Gemini 2.0 Pro](https://quelleia.com/modeles/gemini-2-0-pro.md) | Google DeepMind | non précisée | 83,5 % | 61,9 | https://epoch.ai/benchmarks |
| 25 | [GPT-4.1](https://quelleia.com/modeles/gpt-4-1.md) | OpenAI | non précisée | 83 % | 61,7 | https://epoch.ai/benchmarks |
| 26 | [Gemini 2.0 Flash (Feb 2025)](https://quelleia.com/modeles/gemini-2-0-flash-feb-2025.md) | Google DeepMind | non précisée | 82,2 % | 61,2 | https://epoch.ai/benchmarks |
| 27 | [o1-preview](https://quelleia.com/modeles/o1-preview.md) | OpenAI | non précisée | 81,6 % | 60,9 | https://epoch.ai/benchmarks |
| 28 | [Mistral Medium 3](https://quelleia.com/modeles/mistral-medium-3.md) | Mistral AI | non précisée | 81,6 % | 60,9 | https://epoch.ai/benchmarks |
| 29 | [GPT-4.5](https://quelleia.com/modeles/gpt-4-5.md) | OpenAI | non précisée | 78,6 % | 59,4 | https://epoch.ai/benchmarks |
| 30 | [DeepSeek-V3 (Mar 2025)](https://quelleia.com/modeles/deepseek-v3-mar-2025.md) | DeepSeek | non précisée | 75,5 % | 58,0 | https://epoch.ai/benchmarks |
| 31 | [Gemma 3 27B](https://quelleia.com/modeles/gemma-3-27b.md) | Google DeepMind | non précisée | 74 % | 57,4 | https://epoch.ai/benchmarks |
| 32 | [Llama 4 Maverick](https://quelleia.com/modeles/llama-4-maverick.md) | Meta AI | non précisée | 73 % | 57,0 | https://epoch.ai/benchmarks |
| 33 | [Gemini 1.5 Pro (Sept 2024)](https://quelleia.com/modeles/gemini-1-5-pro-sept-2024.md) | Google DeepMind | non précisée | 70,4 % | 56,0 | https://epoch.ai/benchmarks |
| 34 | [GPT-4.1 nano](https://quelleia.com/modeles/gpt-4-1-nano.md) | OpenAI | non précisée | 70 % | 55,8 | https://epoch.ai/benchmarks |
| 35 | [Qwen3-235B-A22B](https://quelleia.com/modeles/qwen3-235b-a22b.md) | Alibaba | non précisée | 68,9 % | 55,4 | https://epoch.ai/benchmarks |
| 36 | [Qwen2.5-Max](https://quelleia.com/modeles/qwen2-5-max.md) | Alibaba | non précisée | 67,2 % | 54,8 | https://epoch.ai/benchmarks |
| 37 | [Qwen Plus (Jan 2025)](https://quelleia.com/modeles/qwen-plus-jan-2025.md) | Alibaba | non précisée | 65,3 % | 54,1 | https://epoch.ai/benchmarks |
| 38 | [Phi-4](https://quelleia.com/modeles/phi-4.md) | Microsoft | non précisée | 64,9 % | 54,0 | https://epoch.ai/benchmarks |
| 39 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 64,9 % | 53,9 | https://epoch.ai/benchmarks |
| 40 | [Grok-2 (Dec 2024)](https://quelleia.com/modeles/grok-2-dec-2024.md) | xAI | non précisée | 63,5 % | 53,5 | https://epoch.ai/benchmarks |
| 41 | [Qwen2.5-72B](https://quelleia.com/modeles/qwen2-5-72b.md) | Alibaba | non précisée | 63,2 % | 53,4 | https://epoch.ai/benchmarks |
| 42 | [Llama 4 Scout](https://quelleia.com/modeles/llama-4-scout.md) | Meta AI | non précisée | 62,3 % | 53,1 | https://epoch.ai/benchmarks |
| 43 | [Gemini 1.5 Flash (Sep 2024)](https://quelleia.com/modeles/gemini-1-5-flash-sep-2024.md) | Google DeepMind | non précisée | 61,9 % | 52,9 | https://epoch.ai/benchmarks |
| 44 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 56,9 % | 51,3 | https://epoch.ai/benchmarks |
| 45 | [Qwen-Turbo](https://quelleia.com/modeles/qwen-turbo.md) | Alibaba | non précisée | 56,2 % | 51,1 | https://epoch.ai/benchmarks |
| 46 | [Qwen2.5-32B](https://quelleia.com/modeles/qwen2-5-32b.md) | Alibaba | non précisée | 56,1 % | 51,0 | https://epoch.ai/benchmarks |
| 47 | [GPT-4o (Aug 2024)](https://quelleia.com/modeles/gpt-4o-aug-2024.md) | OpenAI | non précisée | 53,3 % | 50,1 | https://epoch.ai/benchmarks |
| 48 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 52,6 % | 49,9 | https://epoch.ai/benchmarks |
| 49 | [Claude 3.5 Sonnet](https://quelleia.com/modeles/claude-3-5-sonnet.md) | Anthropic | non précisée | 51,7 % | 49,6 | https://epoch.ai/benchmarks |
| 50 | [GPT-4o (May 2024)](https://quelleia.com/modeles/gpt-4o-may-2024.md) | OpenAI | non précisée | 51 % | 49,4 | https://epoch.ai/benchmarks |
| 51 | [Mistral Large 2 (Nov 2024)](https://quelleia.com/modeles/mistral-large-2-nov-2024.md) | Mistral AI | non précisée | 50,3 % | 49,2 | https://epoch.ai/benchmarks |
| 52 | [Llama 3.1-405B](https://quelleia.com/modeles/llama-3-1-405b.md) | Meta AI | non précisée | 49,8 % | 49,0 | https://epoch.ai/benchmarks |
| 52 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 49,8 % | 49,0 | https://epoch.ai/benchmarks |
| 54 | [Mistral Small 3.1](https://quelleia.com/modeles/mistral-small-3-1.md) | Mistral AI | non précisée | 46,8 % | 48,0 | https://epoch.ai/benchmarks |
| 55 | [GPT-4 Turbo (Apr 2024)](https://quelleia.com/modeles/gpt-4-turbo-apr-2024.md) | OpenAI | non précisée | 46,7 % | 48,0 | https://epoch.ai/benchmarks |
| 56 | [Claude 3.5 Haiku](https://quelleia.com/modeles/claude-3-5-haiku.md) | Anthropic | non précisée | 46,4 % | 47,9 | https://epoch.ai/benchmarks |
| 57 | [Mistral Large 2 (Jul 2024)](https://quelleia.com/modeles/mistral-large-2-jul-2024.md) | Mistral AI | non précisée | 44,8 % | 47,4 | https://epoch.ai/benchmarks |
| 57 | [Mistral Small 3](https://quelleia.com/modeles/mistral-small-3.md) | Mistral AI | non précisée | 44,8 % | 47,4 | https://epoch.ai/benchmarks |
| 59 | [Tulu 3 (Tülu 3) 70B](https://quelleia.com/modeles/tulu-3-tulu-3-70b.md) | Allen Institute for AI | non précisée | 42,7 % | 46,7 | https://epoch.ai/benchmarks |
| 60 | [Llama 3.3 70B](https://quelleia.com/modeles/llama-3-3-70b.md) | Meta AI | non précisée | 41,6 % | 46,4 | https://epoch.ai/benchmarks |
| 61 | [Gemini 1.5 Pro (May 2024)](https://quelleia.com/modeles/gemini-1-5-pro-may-2024.md) | Google DeepMind | non précisée | 40,7 % | 46,1 | https://epoch.ai/benchmarks |
| 62 | [GPT-4 Turbo (Nov 2023)](https://quelleia.com/modeles/gpt-4-turbo-nov-2023.md) | OpenAI | non précisée | 40 % | 45,8 | https://epoch.ai/benchmarks |
| 63 | [Llama 3.2 90B](https://quelleia.com/modeles/llama-3-2-90b.md) | Meta AI | non précisée | 39,4 % | 45,6 | https://epoch.ai/benchmarks |
| 64 | [Qwen2-72B](https://quelleia.com/modeles/qwen2-72b.md) | Alibaba | non précisée | 39,1 % | 45,5 | https://epoch.ai/benchmarks |
| 65 | [Claude 3 Opus](https://quelleia.com/modeles/claude-3-opus.md) | Anthropic | non précisée | 37,5 % | 45,0 | https://epoch.ai/benchmarks |
| 66 | [Llama 3.1-70B](https://quelleia.com/modeles/llama-3-1-70b.md) | Meta AI | non précisée | 36,7 % | 44,7 | https://epoch.ai/benchmarks |
| 67 | [Gemma 2 27B](https://quelleia.com/modeles/gemma-2-27b.md) | Google DeepMind | non précisée | 27,9 % | 41,5 | https://epoch.ai/benchmarks |
| 68 | [WizardLM-2 8x22B](https://quelleia.com/modeles/wizardlm-2-8x22b.md) | Microsoft | non précisée | 25,7 % | 40,6 | https://epoch.ai/benchmarks |
| 69 | [Yi-1.5-34B](https://quelleia.com/modeles/yi-1-5-34b.md) | 01.AI | non précisée | 25,5 % | 40,5 | https://epoch.ai/benchmarks |
| 70 | [Gemini 1.5 Flash (May 2024)](https://quelleia.com/modeles/gemini-1-5-flash-may-2024.md) | Google DeepMind | non précisée | 25,1 % | 40,4 | https://epoch.ai/benchmarks |
| 71 | [Mistral Large](https://quelleia.com/modeles/mistral-large.md) | Mistral AI | non précisée | 24,5 % | 40,1 | https://epoch.ai/benchmarks |
| 72 | [Mixtral 8x22B](https://quelleia.com/modeles/mixtral-8x22b.md) | Mistral AI | non précisée | 24,2 % | 40,0 | https://epoch.ai/benchmarks |
| 73 | [GPT-4 (Jun 2023)](https://quelleia.com/modeles/gpt-4-jun-2023.md) | OpenAI | non précisée | 23 % | 39,4 | https://epoch.ai/benchmarks |
| 74 | [Llama 3.1-8B](https://quelleia.com/modeles/llama-3-1-8b.md) | Meta AI | non précisée | 22,9 % | 39,4 | https://epoch.ai/benchmarks |
| 75 | [Hermes 2 Theta Llama-3 70B](https://quelleia.com/modeles/hermes-2-theta-llama-3-70b.md) | Nous Research | non précisée | 22,7 % | 39,3 | https://epoch.ai/benchmarks |
| 76 | [Llama 3-70B](https://quelleia.com/modeles/llama-3-70b.md) | Meta AI | non précisée | 22,6 % | 39,2 | https://epoch.ai/benchmarks |
| 77 | [Gemma 2 9B](https://quelleia.com/modeles/gemma-2-9b.md) | Google DeepMind | non précisée | 21 % | 38,5 | https://epoch.ai/benchmarks |
| 78 | [Claude 3 Sonnet](https://quelleia.com/modeles/claude-3-sonnet.md) | Anthropic | non précisée | 18,2 % | 37,1 | https://epoch.ai/benchmarks |
| 79 | [phi-3-medium 14B](https://quelleia.com/modeles/phi-3-medium-14b.md) | Microsoft | non précisée | 17,6 % | 36,8 | https://epoch.ai/benchmarks |
| 80 | [GPT-3.5 Turbo (Nov 2023)](https://quelleia.com/modeles/gpt-3-5-turbo-nov-2023.md) | OpenAI | non précisée | 15,9 % | 35,8 | https://epoch.ai/benchmarks |
| 81 | [Ministral 8B](https://quelleia.com/modeles/ministral-8b.md) | Mistral AI | non précisée | 14,9 % | 35,2 | https://epoch.ai/benchmarks |
| 82 | [Claude 3 Haiku](https://quelleia.com/modeles/claude-3-haiku.md) | Anthropic | non précisée | 14,9 % | 35,2 | https://epoch.ai/benchmarks |
| 83 | [Ministral 3B](https://quelleia.com/modeles/ministral-3b.md) | Mistral AI | non précisée | 14,4 % | 34,9 | https://epoch.ai/benchmarks |
| 84 | [Claude 2](https://quelleia.com/modeles/claude-2.md) | Anthropic | non précisée | 11,7 % | 33,0 | https://epoch.ai/benchmarks |
| 85 | [DBRX](https://quelleia.com/modeles/dbrx.md) | Databricks | non précisée | 11,7 % | 32,9 | https://epoch.ai/benchmarks |
| 86 | [GPT-3.5 Turbo (Jan 2024)](https://quelleia.com/modeles/gpt-3-5-turbo-jan-2024.md) | OpenAI | non précisée | 11,6 % | 32,9 | https://epoch.ai/benchmarks |
| 87 | [Gemini 1.0 Pro](https://quelleia.com/modeles/gemini-1-0-pro.md) | Google DeepMind | non précisée | 11,2 % | 32,6 | https://epoch.ai/benchmarks |
| 88 | [Mistral NeMo](https://quelleia.com/modeles/mistral-nemo.md) | Mistral AI | non précisée | 10,8 % | 32,3 | https://epoch.ai/benchmarks |
| 89 | [Mixtral 8x7B](https://quelleia.com/modeles/mixtral-8x7b.md) | Mistral AI | non précisée | 10 % | 31,5 | https://epoch.ai/benchmarks |
| 90 | [DeepSeek LLM 67B](https://quelleia.com/modeles/deepseek-llm-67b.md) | DeepSeek | non précisée | 6,4 % | 27,7 | https://epoch.ai/benchmarks |
| 91 | [Llama 3-8B](https://quelleia.com/modeles/llama-3-8b.md) | Meta AI | non précisée | 6,1 % | 27,3 | https://epoch.ai/benchmarks |
| 92 | [Yi-34B](https://quelleia.com/modeles/yi-34b.md) | 01.AI | non précisée | 5,1 % | 25,9 | https://epoch.ai/benchmarks |
| 93 | [Mistral 7B v0.3](https://quelleia.com/modeles/mistral-7b-v0-3.md) | Mistral AI | non précisée | 3,7 % | 23,1 | https://epoch.ai/benchmarks |
| 94 | [Llama 2-70B](https://quelleia.com/modeles/llama-2-70b.md) | Meta AI | non précisée | 3,3 % | 22,1 | https://epoch.ai/benchmarks |

## En bref

**Que mesure MATH Level 5 ?** Les 1 324 problèmes les plus durs du jeu MATH, tirés de concours de lycée américains comme l'AMC et l'AIME. Sur Quelle IA, il est rangé dans la tâche Mathématiques.

**Comment MATH Level 5 est-il noté ?** Part de réponses finales justes ; l'équivalence avec la solution attendue est jugée par un modèle correcteur. Un modèle qui obtient 50 % a un score IA d'environ 49.

**Qui est en tête sur MATH Level 5 ?** GPT-5 (OpenAI) est en tête de MATH Level 5 avec 98,1 %, dans l'édition du 28 septembre 2026. Suivent GPT-5 mini (97,8 %) et o4-mini (97,8 %). 94 modèles y sont mesurés.

**Quelles sont les limites de MATH Level 5 ?** Jeu public depuis 2021, donc probablement vu à l'entraînement. Les meilleurs modèles dépassent 98 % : le test ne départage plus le haut du classement. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse MATH Level 5 dans le score IA ?** MATH Level 5 compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Mathématiques (10 % du score général) repose sur 8 autres benchmarks.

**Qui maintient MATH Level 5 ?** Epoch AI pour l'évaluation ; jeu MATH de Hendrycks et al. (2021). Sa page de référence : epoch.ai/benchmarks/math-level-5.

## Les autres benchmarks de la tâche Mathématiques

- [Arena, questions de maths](https://quelleia.com/benchmarks/arena_maths.md) : 269 modèles · 1,25 % du score
- [OTIS Mock AIME 2024-2025](https://quelleia.com/benchmarks/otis_mock_aime_2024_2025.md) : 190 modèles · 1,25 % du score, saturé
- [FrontierMath, paliers 1 à 3 (v2)](https://quelleia.com/benchmarks/frontiermath_tiers_1_3_v2.md) : 77 modèles · 1,25 % du score
- [FrontierMath, paliers 1 à 3 (version 2025)](https://quelleia.com/benchmarks/frontiermath.md) : 70 modèles · 1,25 % du score
- [ProofBench](https://quelleia.com/benchmarks/proofbench.md) : 70 modèles · 1,25 % du score, saturé
- [FrontierMath, palier 4 (v2)](https://quelleia.com/benchmarks/frontiermath_tier_4_v2.md) : 59 modèles · 1,25 % du score, saturé
- [FrontierMath, palier 4 (version 2025)](https://quelleia.com/benchmarks/frontiermath_tier_4.md) : 55 modèles · 1,25 % du score
- [FrontierMath Erdős](https://quelleia.com/benchmarks/frontiermath_erdos.md) : 5 modèles · 1,25 % du score
- [GSM8K](https://quelleia.com/benchmarks/gsm8k.md) : 82 modèles · hors score, archivé
- [LiveBench, mathématiques](https://quelleia.com/benchmarks/livebench_maths.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
