# FrontierMath, paliers 1 à 3 (version 2025)

> Fiche du benchmark FrontierMath, paliers 1 à 3 (version 2025) sur Quelle IA, édition du 28 septembre 2026. Environ 300 problèmes de mathématiques inédits, écrits par des mathématiciens, qui demandent chacun plusieurs heures à un spécialiste. En tête au 28 septembre 2026 : GPT-5.5 Pro (52,4 %). Notation, limites et classement des 70 modèles mesurés.

Page : https://quelleia.com/benchmarks/frontiermath/
Source du benchmark : https://epoch.ai/benchmarks/frontiermath
Mainteneur : Epoch AI
Tâche : Mathématiques
État : actif

## À quoi il sert

Sur Quelle IA, FrontierMath, paliers 1 à 3 (version 2025) sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 80.

## Comment c'est noté

Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé.

Pour le calcul, ce score est ramené entre 0 et 1 : 0 % vaut 0 et 57 %, le plafond retenu, vaut 1.

## Ce qu'il ne dit pas

Version remplacée en juin 2026 : plus de quatre énoncés sur dix ont dû être corrigés, et Epoch estime le score maximal à 57 %. OpenAI a financé le jeu et en détient une partie.

## Qui le tient

Epoch AI.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 28 % a un score IA d'environ 80. Le meilleur, GPT-5.5 Pro, atteint 52,4 %. Le benchmark sera dit saturé quand un modèle atteindra 54,1 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : moins de 1 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 20 %
- Score IA 100 (niveau de Claude Opus 5.5) : 55 %

## Son poids dans le score IA

1,25 % du score général. FrontierMath, paliers 1 à 3 (version 2025) porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.

## Classement (70 modèles mesurés · 101 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-5.5 Pro](https://quelleia.com/modeles/gpt-5-5-pro.md) | OpenAI | Élevée | 52,4 % | 94,9 | https://epoch.ai/benchmarks |
| 2 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 51,7 % | 94,0 | https://epoch.ai/benchmarks |
| 3 | [GPT-5.4 Pro](https://quelleia.com/modeles/gpt-5-4-pro.md) | OpenAI | Maximale | 50 % | 92,1 | https://epoch.ai/benchmarks |
| 4 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 47,6 % | 90,0 | https://epoch.ai/benchmarks |
| 5 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 47,2 % | 89,7 | https://epoch.ai/benchmarks |
| 6 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Maximale | 43,8 % | 87,5 | https://epoch.ai/benchmarks |
| 7 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Maximale | 40,7 % | 85,7 | https://epoch.ai/benchmarks |
| 7 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Maximale | 40,7 % | 85,7 | https://epoch.ai/benchmarks |
| 9 | [Muse Spark](https://quelleia.com/modeles/muse-spark.md) | Meta AI | non précisée | 39 % | 84,9 | https://epoch.ai/benchmarks |
| 10 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | Élevée | 39 % | 84,9 | https://epoch.ai/benchmarks |
| 10 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 39 % | 84,9 | https://epoch.ai/benchmarks |
| 12 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 37,6 % | 84,2 | https://epoch.ai/benchmarks |
| 13 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 36,9 % | 83,9 | https://epoch.ai/benchmarks |
| 14 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | non précisée | 35,6 % | 83,3 | https://epoch.ai/benchmarks |
| 15 | [GLM-5.1](https://quelleia.com/modeles/glm-5-1.md) | Z.ai (Zhipu AI) | non précisée | 33,4 % | 82,3 | https://epoch.ai/benchmarks |
| 16 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 32,4 % | 81,9 | https://epoch.ai/benchmarks |
| 17 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | Budget | 32,4 % | 81,9 | https://epoch.ai/benchmarks |
| 18 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Élevée | 31 % | 81,3 | https://epoch.ai/benchmarks |
| 19 | [Gemini 2.5 Deep Think](https://quelleia.com/modeles/gemini-2-5-deep-think.md) | Google DeepMind | non précisée | 29 % | 80,4 | https://epoch.ai/benchmarks |
| 20 | [GPT-5.4 Mini](https://quelleia.com/modeles/gpt-5-4-mini.md) | OpenAI | Élevée | 28,3 % | 80,1 | https://epoch.ai/benchmarks |
| 21 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 27,9 % | 80,0 | https://epoch.ai/benchmarks |
| 22 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | Élevée | 27,2 % | 79,7 | https://epoch.ai/benchmarks |
| 23 | [Qwen 3.6 Plus](https://quelleia.com/modeles/qwen-3-6-plus.md) | Alibaba | non précisée | 26,2 % | 79,2 | https://epoch.ai/benchmarks |
| 24 | [GPT-5.4 Nano](https://quelleia.com/modeles/gpt-5-4-nano.md) | OpenAI | Élevée | 25,9 % | 79,1 | https://epoch.ai/benchmarks |
| 25 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Élevée | 24,8 % | 78,6 | https://epoch.ai/benchmarks |
| 26 | [Qwen 3.6 Max (Preview)](https://quelleia.com/modeles/qwen-3-6-max-preview.md) | Alibaba | non précisée | 23,1 % | 77,9 | https://epoch.ai/benchmarks |
| 27 | [DeepSeek-V3.2](https://quelleia.com/modeles/deepseek-v3-2.md) | DeepSeek | non précisée | 22,1 % | 77,5 | https://epoch.ai/benchmarks |
| 28 | [Kimi K2 Thinking](https://quelleia.com/modeles/kimi-k2-thinking.md) | Moonshot | non précisée | 21,4 % | 77,1 | https://epoch.ai/benchmarks |
| 29 | [Qwen 3.5 Plus (hosted 397B-A17B)](https://quelleia.com/modeles/qwen-3-5-plus-hosted-397b-a17b.md) | Alibaba | non précisée | 21 % | 77,0 | https://epoch.ai/benchmarks |
| 30 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | non précisée | 20,7 % | 76,8 | https://epoch.ai/benchmarks |
| 31 | [Grok 4](https://quelleia.com/modeles/grok-4.md) | xAI | non précisée | 19,7 % | 76,3 | https://epoch.ai/benchmarks |
| 32 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Élevée | 18,7 % | 75,9 | https://epoch.ai/benchmarks |
| 33 | [GLM-5](https://quelleia.com/modeles/glm-5.md) | Z.ai (Zhipu AI) | non précisée | 16,4 % | 74,8 | https://epoch.ai/benchmarks |
| 34 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | Budget | 15,2 % | 74,1 | https://epoch.ai/benchmarks |
| 35 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 14,1 % | 73,5 | https://epoch.ai/benchmarks |
| 36 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 12,4 % | 72,5 | https://epoch.ai/benchmarks |
| 37 | [Qwen 3.6 Flash](https://quelleia.com/modeles/qwen-3-6-flash.md) | Alibaba | non précisée | 10,3 % | 71,1 | https://epoch.ai/benchmarks |
| 38 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Élevée | 9,3 % | 70,3 | https://epoch.ai/benchmarks |
| 39 | [Qwen3-235B-A22B-Thinking (Jul 2025)](https://quelleia.com/modeles/qwen3-235b-a22b-thinking-jul-2025.md) | Alibaba | non précisée | 8,5 % | 69,7 | https://epoch.ai/benchmarks |
| 40 | [GPT-5 nano](https://quelleia.com/modeles/gpt-5-nano.md) | OpenAI | Élevée | 8,3 % | 69,5 | https://epoch.ai/benchmarks |
| 41 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | Budget | 7,2 % | 68,6 | https://epoch.ai/benchmarks |
| 42 | [Qwen 3.5 Flash (hosted 35B-A3B)](https://quelleia.com/modeles/qwen-3-5-flash-hosted-35b-a3b.md) | Alibaba | non précisée | 6,2 % | 67,5 | https://epoch.ai/benchmarks |
| 43 | [Claude Haiku 4.5](https://quelleia.com/modeles/claude-haiku-4-5.md) | Anthropic | Budget | 5,9 % | 67,2 | https://epoch.ai/benchmarks |
| 44 | [Grok-3 mini](https://quelleia.com/modeles/grok-3-mini.md) | xAI | Élevée | 5,9 % | 67,1 | https://epoch.ai/benchmarks |
| 45 | [GPT-4.1](https://quelleia.com/modeles/gpt-4-1.md) | OpenAI | non précisée | 5,5 % | 66,7 | https://epoch.ai/benchmarks |
| 46 | [Gemini 2.5 Flash (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-flash-jun-2025.md) | Google DeepMind | non précisée | 4,8 % | 65,8 | https://epoch.ai/benchmarks |
| 47 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | non précisée | 4,5 % | 65,3 | https://epoch.ai/benchmarks |
| 47 | [GPT-4.1 mini](https://quelleia.com/modeles/gpt-4-1-mini.md) | OpenAI | non précisée | 4,5 % | 65,3 | https://epoch.ai/benchmarks |
| 49 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | non précisée | 4,1 % | 64,8 | https://epoch.ai/benchmarks |
| 49 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | Budget | 4,1 % | 64,8 | https://epoch.ai/benchmarks |
| 51 | [GLM-4.6](https://quelleia.com/modeles/glm-4-6.md) | Z.ai (Zhipu AI) | non précisée | 3,8 % | 64,3 | https://epoch.ai/benchmarks |
| 52 | [Grok 3](https://quelleia.com/modeles/grok-3.md) | xAI | non précisée | 3,8 % | 64,2 | https://epoch.ai/benchmarks |
| 53 | [GLM-4.7](https://quelleia.com/modeles/glm-4-7.md) | Z.ai (Zhipu AI) | non précisée | 2,4 % | 61,4 | https://epoch.ai/benchmarks |
| 54 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 2,1 % | 60,4 | https://epoch.ai/benchmarks |
| 55 | [Qwen Plus (Apr 2025)](https://quelleia.com/modeles/qwen-plus-apr-2025.md) | Alibaba | non précisée | 1,7 % | 59,3 | https://epoch.ai/benchmarks |
| 55 | [o1-mini](https://quelleia.com/modeles/o1-mini.md) | OpenAI | Moyenne | 1,7 % | 59,3 | https://epoch.ai/benchmarks |
| 55 | [Gemini 2.0 Flash (Feb 2025)](https://quelleia.com/modeles/gemini-2-0-flash-feb-2025.md) | Google DeepMind | non précisée | 1,7 % | 59,3 | https://epoch.ai/benchmarks |
| 55 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 1,7 % | 59,3 | https://epoch.ai/benchmarks |
| 59 | [Qwen2.5-Max](https://quelleia.com/modeles/qwen2-5-max.md) | Alibaba | non précisée | 1 % | 56,1 | https://epoch.ai/benchmarks |
| 59 | [Claude 3.5 Sonnet](https://quelleia.com/modeles/claude-3-5-sonnet.md) | Anthropic | non précisée | 1 % | 56,1 | https://epoch.ai/benchmarks |
| 59 | [GPT-4.1 nano](https://quelleia.com/modeles/gpt-4-1-nano.md) | OpenAI | non précisée | 1 % | 56,1 | https://epoch.ai/benchmarks |
| 62 | [Llama 4 Maverick](https://quelleia.com/modeles/llama-4-maverick.md) | Meta AI | non précisée | 0,7 % | 53,6 | https://epoch.ai/benchmarks |
| 62 | [Grok-2 (Dec 2024)](https://quelleia.com/modeles/grok-2-dec-2024.md) | xAI | non précisée | 0,7 % | 53,6 | https://epoch.ai/benchmarks |
| 64 | [Mistral Medium 3](https://quelleia.com/modeles/mistral-medium-3.md) | Mistral AI | non précisée | 0,3 % | 52,4 | https://epoch.ai/benchmarks |
| 65 | [GPT-4o (Aug 2024)](https://quelleia.com/modeles/gpt-4o-aug-2024.md) | OpenAI | non précisée | 0,3 % | 52,4 | https://epoch.ai/benchmarks |
| 65 | [Mistral Large 2 (Nov 2024)](https://quelleia.com/modeles/mistral-large-2-nov-2024.md) | Mistral AI | non précisée | 0,3 % | 52,4 | https://epoch.ai/benchmarks |
| 65 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 0,3 % | 52,4 | https://epoch.ai/benchmarks |
| 65 | [Claude 3.5 Haiku](https://quelleia.com/modeles/claude-3-5-haiku.md) | Anthropic | non précisée | 0,3 % | 52,4 | https://epoch.ai/benchmarks |
| 69 | [Llama 4 Scout](https://quelleia.com/modeles/llama-4-scout.md) | Meta AI | non précisée | 0 % | 52,4 | https://epoch.ai/benchmarks |
| 69 | [Gemini 1.5 Flash (Sep 2024)](https://quelleia.com/modeles/gemini-1-5-flash-sep-2024.md) | Google DeepMind | non précisée | 0 % | 52,4 | https://epoch.ai/benchmarks |

## En bref

**Que mesure FrontierMath, paliers 1 à 3 (version 2025) ?** Environ 300 problèmes de mathématiques inédits, écrits par des mathématiciens, qui demandent chacun plusieurs heures à un spécialiste. Sur Quelle IA, il est rangé dans la tâche Mathématiques.

**Comment FrontierMath, paliers 1 à 3 (version 2025) est-il noté ?** Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé. Un modèle qui obtient 28 % a un score IA d'environ 80.

**Qui est en tête sur FrontierMath, paliers 1 à 3 (version 2025) ?** GPT-5.5 Pro (OpenAI) est en tête de FrontierMath, paliers 1 à 3 (version 2025) avec 52,4 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.5 (51,7 %) et GPT-5.4 Pro (50 %). 70 modèles y sont mesurés.

**Quelles sont les limites de FrontierMath, paliers 1 à 3 (version 2025) ?** Version remplacée en juin 2026 : plus de quatre énoncés sur dix ont dû être corrigés, et Epoch estime le score maximal à 57 %. OpenAI a financé le jeu et en détient une partie. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse FrontierMath, paliers 1 à 3 (version 2025) dans le score IA ?** FrontierMath, paliers 1 à 3 (version 2025) compte pour 1,25 % du score général, dans l'édition du 28 septembre 2026. Il porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.

**Qui maintient FrontierMath, paliers 1 à 3 (version 2025) ?** Epoch AI. Sa page de référence : epoch.ai/benchmarks/frontiermath.

## Les autres benchmarks de la tâche Mathématiques

- [Arena, questions de maths](https://quelleia.com/benchmarks/arena_maths.md) : 269 modèles · 1,25 % du score
- [OTIS Mock AIME 2024-2025](https://quelleia.com/benchmarks/otis_mock_aime_2024_2025.md) : 190 modèles · 1,25 % du score, saturé
- [FrontierMath, paliers 1 à 3 (v2)](https://quelleia.com/benchmarks/frontiermath_tiers_1_3_v2.md) : 77 modèles · 1,25 % du score
- [ProofBench](https://quelleia.com/benchmarks/proofbench.md) : 70 modèles · 1,25 % du score, saturé
- [FrontierMath, palier 4 (v2)](https://quelleia.com/benchmarks/frontiermath_tier_4_v2.md) : 59 modèles · 1,25 % du score, saturé
- [FrontierMath, palier 4 (version 2025)](https://quelleia.com/benchmarks/frontiermath_tier_4.md) : 55 modèles · 1,25 % du score
- [FrontierMath Erdős](https://quelleia.com/benchmarks/frontiermath_erdos.md) : 5 modèles · 1,25 % du score
- [MATH Level 5](https://quelleia.com/benchmarks/math_level_5.md) : 94 modèles · hors score, archivé
- [GSM8K](https://quelleia.com/benchmarks/gsm8k.md) : 82 modèles · hors score, archivé
- [LiveBench, mathématiques](https://quelleia.com/benchmarks/livebench_maths.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
