# FrontierMath, palier 4 (version 2025)

> Fiche du benchmark FrontierMath, palier 4 (version 2025) sur Quelle IA, édition du 28 septembre 2026. Une cinquantaine de problèmes de niveau recherche, les plus durs de FrontierMath, qui peuvent occuper un mathématicien plusieurs jours. En tête au 28 septembre 2026 : AI Co-Mathematician (47,9 %). Notation, limites et classement des 55 modèles mesurés.

Page : https://quelleia.com/benchmarks/frontiermath_tier_4/
Source du benchmark : https://epoch.ai/benchmarks/frontiermath
Mainteneur : Epoch AI
Tâche : Mathématiques
État : actif

## À quoi il sert

Sur Quelle IA, FrontierMath, palier 4 (version 2025) sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 90.

## Comment c'est noté

Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé.

Pour le calcul, ce score est ramené entre 0 et 1 : 0 % vaut 0 et 60 %, le plafond retenu, vaut 1.

## Ce qu'il ne dit pas

Version remplacée en juin 2026 après correction de 12 énoncés et retrait de 7 autres ; Epoch estime le score maximal à 60 %. OpenAI a financé le jeu et en détient une partie.

## Qui le tient

Epoch AI.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 30 % a un score IA d'environ 90. Le meilleur, AI Co-Mathematician, atteint 47,9 %. Le benchmark sera dit saturé quand un modèle atteindra 57 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : moins de 1 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 4 %
- Score IA 100 (niveau de Claude Opus 5.5) : 52 %

## Son poids dans le score IA

1,25 % du score général. FrontierMath, palier 4 (version 2025) porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.

## Classement (55 modèles mesurés · 72 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [AI Co-Mathematician](https://quelleia.com/modeles/ai-co-mathematician.md) | Google DeepMind | non précisée | 47,9 % | 97,3 | https://epoch.ai/benchmarks |
| 2 | [GPT-5.5 Pro](https://quelleia.com/modeles/gpt-5-5-pro.md) | OpenAI | Maximale | 39,6 % | 93,6 | https://epoch.ai/benchmarks |
| 3 | [GPT-5.4 Pro](https://quelleia.com/modeles/gpt-5-4-pro.md) | OpenAI | non précisée | 37,5 % | 92,8 | https://epoch.ai/benchmarks |
| 4 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 35,4 % | 92,0 | https://epoch.ai/benchmarks |
| 5 | [GPT-5.2 Pro](https://quelleia.com/modeles/gpt-5-2-pro.md) | OpenAI | non précisée | 31,3 % | 90,6 | https://epoch.ai/benchmarks |
| 6 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 31,3 % | 90,6 | https://epoch.ai/benchmarks |
| 7 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 27,1 % | 89,1 | https://epoch.ai/benchmarks |
| 8 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Maximale | 22,9 % | 87,6 | https://epoch.ai/benchmarks |
| 9 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Maximale | 22,9 % | 87,6 | https://epoch.ai/benchmarks |
| 10 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Élevée | 18,8 % | 86,0 | https://epoch.ai/benchmarks |
| 11 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 18,8 % | 86,0 | https://epoch.ai/benchmarks |
| 12 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 16,7 % | 85,1 | https://epoch.ai/benchmarks |
| 13 | [Muse Spark](https://quelleia.com/modeles/muse-spark.md) | Meta AI | non précisée | 14,6 % | 84,2 | https://epoch.ai/benchmarks |
| 13 | [GPT-5 Pro](https://quelleia.com/modeles/gpt-5-pro.md) | OpenAI | Élevée | 14,6 % | 84,2 | https://epoch.ai/benchmarks |
| 15 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | Élevée | 14,6 % | 84,2 | https://epoch.ai/benchmarks |
| 16 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 14,6 % | 84,2 | https://epoch.ai/benchmarks |
| 17 | [GLM-5.1](https://quelleia.com/modeles/glm-5-1.md) | Z.ai (Zhipu AI) | non précisée | 12,5 % | 83,1 | https://epoch.ai/benchmarks |
| 17 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 12,5 % | 83,1 | https://epoch.ai/benchmarks |
| 17 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Élevée | 12,5 % | 83,1 | https://epoch.ai/benchmarks |
| 20 | [Gemini 2.5 Deep Think](https://quelleia.com/modeles/gemini-2-5-deep-think.md) | Google DeepMind | non précisée | 10,4 % | 81,9 | https://epoch.ai/benchmarks |
| 21 | [Qwen 3.6 Plus](https://quelleia.com/modeles/qwen-3-6-plus.md) | Alibaba | non précisée | 8,3 % | 80,5 | https://epoch.ai/benchmarks |
| 22 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | Budget | 8,3 % | 80,5 | https://epoch.ai/benchmarks |
| 23 | [GPT-5.4 Nano](https://quelleia.com/modeles/gpt-5-4-nano.md) | OpenAI | Élevée | 6,3 % | 78,8 | https://epoch.ai/benchmarks |
| 23 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | Élevée | 6,3 % | 78,8 | https://epoch.ai/benchmarks |
| 23 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Élevée | 6,3 % | 78,8 | https://epoch.ai/benchmarks |
| 26 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 4,2 % | 76,5 | https://epoch.ai/benchmarks |
| 27 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | non précisée | 4,2 % | 76,5 | https://epoch.ai/benchmarks |
| 27 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | non précisée | 4,2 % | 76,5 | https://epoch.ai/benchmarks |
| 27 | [Qwen 3.6 Max (Preview)](https://quelleia.com/modeles/qwen-3-6-max-preview.md) | Alibaba | non précisée | 4,2 % | 76,5 | https://epoch.ai/benchmarks |
| 27 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | Budget | 4,2 % | 76,5 | https://epoch.ai/benchmarks |
| 27 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | Budget | 4,2 % | 76,5 | https://epoch.ai/benchmarks |
| 27 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 4,2 % | 76,5 | https://epoch.ai/benchmarks |
| 27 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | Budget | 4,2 % | 76,5 | https://epoch.ai/benchmarks |
| 27 | [Gemini 2.5 Flash (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-flash-jun-2025.md) | Google DeepMind | non précisée | 4,2 % | 76,5 | https://epoch.ai/benchmarks |
| 27 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 4,2 % | 76,5 | https://epoch.ai/benchmarks |
| 36 | [GLM-4.6](https://quelleia.com/modeles/glm-4-6.md) | Z.ai (Zhipu AI) | non précisée | 2,1 % | 72,8 | https://epoch.ai/benchmarks |
| 37 | [GLM-5](https://quelleia.com/modeles/glm-5.md) | Z.ai (Zhipu AI) | non précisée | 2,1 % | 72,7 | https://epoch.ai/benchmarks |
| 37 | [DeepSeek-V3.2](https://quelleia.com/modeles/deepseek-v3-2.md) | DeepSeek | non précisée | 2,1 % | 72,7 | https://epoch.ai/benchmarks |
| 39 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Élevée | 2,1 % | 72,7 | https://epoch.ai/benchmarks |
| 39 | [Grok 4](https://quelleia.com/modeles/grok-4.md) | xAI | non précisée | 2,1 % | 72,7 | https://epoch.ai/benchmarks |
| 39 | [Qwen 3.5 Plus (hosted 397B-A17B)](https://quelleia.com/modeles/qwen-3-5-plus-hosted-397b-a17b.md) | Alibaba | non précisée | 2,1 % | 72,7 | https://epoch.ai/benchmarks |
| 39 | [Claude Haiku 4.5](https://quelleia.com/modeles/claude-haiku-4-5.md) | Anthropic | Budget | 2,1 % | 72,7 | https://epoch.ai/benchmarks |
| 39 | [GPT-5 nano](https://quelleia.com/modeles/gpt-5-nano.md) | OpenAI | Moyenne | 2,1 % | 72,7 | https://epoch.ai/benchmarks |
| 44 | [GPT-5.4 Mini](https://quelleia.com/modeles/gpt-5-4-mini.md) | OpenAI | Élevée | 2,1 % | 72,7 | https://epoch.ai/benchmarks |
| 44 | [Grok 4 Heavy](https://quelleia.com/modeles/grok-4-heavy.md) | xAI | non précisée | 2,1 % | 72,7 | https://epoch.ai/benchmarks |
| 46 | [GLM-4.7](https://quelleia.com/modeles/glm-4-7.md) | Z.ai (Zhipu AI) | non précisée | 0 % | 66,0 | https://epoch.ai/benchmarks |
| 46 | [Kimi K2 Thinking](https://quelleia.com/modeles/kimi-k2-thinking.md) | Moonshot | non précisée | 0 % | 66,0 | https://epoch.ai/benchmarks |
| 46 | [Qwen 3.6 Flash](https://quelleia.com/modeles/qwen-3-6-flash.md) | Alibaba | non précisée | 0 % | 66,0 | https://epoch.ai/benchmarks |
| 46 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | non précisée | 0 % | 66,0 | https://epoch.ai/benchmarks |
| 46 | [Qwen 3.5 Flash (hosted 35B-A3B)](https://quelleia.com/modeles/qwen-3-5-flash-hosted-35b-a3b.md) | Alibaba | non précisée | 0 % | 66,0 | https://epoch.ai/benchmarks |
| 46 | [Qwen3-235B-A22B-Thinking (Jul 2025)](https://quelleia.com/modeles/qwen3-235b-a22b-thinking-jul-2025.md) | Alibaba | non précisée | 0 % | 66,0 | https://epoch.ai/benchmarks |
| 46 | [Grok 3](https://quelleia.com/modeles/grok-3.md) | xAI | non précisée | 0 % | 66,0 | https://epoch.ai/benchmarks |
| 46 | [GPT-4.1](https://quelleia.com/modeles/gpt-4-1.md) | OpenAI | non précisée | 0 % | 66,0 | https://epoch.ai/benchmarks |
| 46 | [Claude 3.5 Sonnet](https://quelleia.com/modeles/claude-3-5-sonnet.md) | Anthropic | non précisée | 0 % | 66,0 | https://epoch.ai/benchmarks |
| 46 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 0 % | 66,0 | https://epoch.ai/benchmarks |

## En bref

**Que mesure FrontierMath, palier 4 (version 2025) ?** Une cinquantaine de problèmes de niveau recherche, les plus durs de FrontierMath, qui peuvent occuper un mathématicien plusieurs jours. Sur Quelle IA, il est rangé dans la tâche Mathématiques.

**Comment FrontierMath, palier 4 (version 2025) est-il noté ?** Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé. Un modèle qui obtient 30 % a un score IA d'environ 90.

**Qui est en tête sur FrontierMath, palier 4 (version 2025) ?** AI Co-Mathematician (Google DeepMind) est en tête de FrontierMath, palier 4 (version 2025) avec 47,9 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.5 Pro (39,6 %) et GPT-5.4 Pro (37,5 %). 55 modèles y sont mesurés.

**Quelles sont les limites de FrontierMath, palier 4 (version 2025) ?** Version remplacée en juin 2026 après correction de 12 énoncés et retrait de 7 autres ; Epoch estime le score maximal à 60 %. OpenAI a financé le jeu et en détient une partie. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse FrontierMath, palier 4 (version 2025) dans le score IA ?** FrontierMath, palier 4 (version 2025) compte pour 1,25 % du score général, dans l'édition du 28 septembre 2026. Il porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.

**Qui maintient FrontierMath, palier 4 (version 2025) ?** Epoch AI. Sa page de référence : epoch.ai/benchmarks/frontiermath.

## Les autres benchmarks de la tâche Mathématiques

- [Arena, questions de maths](https://quelleia.com/benchmarks/arena_maths.md) : 269 modèles · 1,25 % du score
- [OTIS Mock AIME 2024-2025](https://quelleia.com/benchmarks/otis_mock_aime_2024_2025.md) : 190 modèles · 1,25 % du score, saturé
- [FrontierMath, paliers 1 à 3 (v2)](https://quelleia.com/benchmarks/frontiermath_tiers_1_3_v2.md) : 77 modèles · 1,25 % du score
- [FrontierMath, paliers 1 à 3 (version 2025)](https://quelleia.com/benchmarks/frontiermath.md) : 70 modèles · 1,25 % du score
- [ProofBench](https://quelleia.com/benchmarks/proofbench.md) : 70 modèles · 1,25 % du score, saturé
- [FrontierMath, palier 4 (v2)](https://quelleia.com/benchmarks/frontiermath_tier_4_v2.md) : 59 modèles · 1,25 % du score, saturé
- [FrontierMath Erdős](https://quelleia.com/benchmarks/frontiermath_erdos.md) : 5 modèles · 1,25 % du score
- [MATH Level 5](https://quelleia.com/benchmarks/math_level_5.md) : 94 modèles · hors score, archivé
- [GSM8K](https://quelleia.com/benchmarks/gsm8k.md) : 82 modèles · hors score, archivé
- [LiveBench, mathématiques](https://quelleia.com/benchmarks/livebench_maths.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
