# FrontierMath, palier 4 (v2)

> Fiche du benchmark FrontierMath, palier 4 (v2) sur Quelle IA, édition du 28 septembre 2026. 43 problèmes de niveau recherche, corrigés en 2026, qui peuvent occuper un mathématicien professionnel plusieurs jours. En tête au 28 septembre 2026 : GPT-6 Astra (97,6 %). Notation, limites et classement des 59 modèles mesurés.

Page : https://quelleia.com/benchmarks/frontiermath_tier_4_v2/
Source du benchmark : https://epoch.ai/benchmarks/frontiermath
Mainteneur : Epoch AI
Tâche : Mathématiques
État : saturé

## À quoi il sert

Sur Quelle IA, FrontierMath, palier 4 (v2) sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 90.

## Comment c'est noté

Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé.

## Ce qu'il ne dit pas

Avec 43 problèmes, chacun pèse plus de deux points, et le meilleur modèle frôle déjà le maximum. OpenAI a financé le jeu et en détient une partie.

## Qui le tient

Epoch AI.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 90. Le meilleur, GPT-6 Astra, atteint 97,6 %. Le seuil de saturation (95 %) est franchi : au sommet, les meilleurs modèles ne se départagent plus.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : moins de 1 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 4 %
- Score IA 100 (niveau de Claude Opus 5.5) : 90 %

## Son poids dans le score IA

1,25 % du score général. FrontierMath, palier 4 (v2) porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

## Classement (59 modèles mesurés · 66 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | Maximale | 97,6 % | 106,3 | https://epoch.ai/benchmarks |
| 2 | [Claude Opus 5.5](https://quelleia.com/modeles/claude-opus-5-5.md) | Anthropic | Maximale | 95 % | 103,0 | https://epoch.ai/benchmarks |
| 3 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Maximale | 90,2 % | 99,8 | https://epoch.ai/benchmarks |
| 4 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | Maximale | 87,8 % | 98,8 | https://epoch.ai/benchmarks |
| 5 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 82,9 % | 97,1 | https://epoch.ai/benchmarks |
| 6 | [Claude Sonnet 5.5](https://quelleia.com/modeles/claude-sonnet-5-5.md) | Anthropic | Maximale | 80,5 % | 96,4 | https://epoch.ai/benchmarks |
| 7 | [GPT-5.5 Pro](https://quelleia.com/modeles/gpt-5-5-pro.md) | OpenAI | Maximale | 78 % | 95,7 | https://epoch.ai/benchmarks |
| 8 | [AI Co-Mathematician](https://quelleia.com/modeles/ai-co-mathematician.md) | Google DeepMind | non précisée | 75,6 % | 95,2 | https://epoch.ai/benchmarks |
| 9 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 73,2 % | 94,6 | https://epoch.ai/benchmarks |
| 10 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 72,5 % | 94,5 | https://epoch.ai/benchmarks |
| 11 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 70,7 % | 94,1 | https://epoch.ai/benchmarks |
| 12 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | Maximale | 61 % | 92,2 | https://epoch.ai/benchmarks |
| 13 | [GPT-5.4 Pro](https://quelleia.com/modeles/gpt-5-4-pro.md) | OpenAI | Maximale | 58,5 % | 91,8 | https://epoch.ai/benchmarks |
| 14 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 56,1 % | 91,3 | https://epoch.ai/benchmarks |
| 15 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 49 % | 90,1 | https://epoch.ai/benchmarks |
| 16 | [Muse Spark 1.3](https://quelleia.com/modeles/muse-spark-1-3.md) | Meta AI | Maximale | 46,3 % | 89,6 | https://epoch.ai/benchmarks |
| 16 | [Qwen 3.8 Max](https://quelleia.com/modeles/qwen-3-8-max.md) | Alibaba | Maximale | 46,3 % | 89,6 | https://epoch.ai/benchmarks |
| 18 | [GPT-5.2 Pro](https://quelleia.com/modeles/gpt-5-2-pro.md) | OpenAI | Maximale | 46 % | 89,6 | https://epoch.ai/benchmarks |
| 19 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | Maximale | 39 % | 88,4 | https://epoch.ai/benchmarks |
| 20 | [Gemini 3.7 Flash](https://quelleia.com/modeles/gemini-3-7-flash.md) | Google DeepMind | Élevée | 36,6 % | 87,9 | https://epoch.ai/benchmarks |
| 21 | [Qwen3.8 Max (0902)](https://quelleia.com/modeles/qwen3-8-max-0902.md) | Alibaba | Maximale | 34,1 % | 87,4 | https://epoch.ai/benchmarks |
| 21 | [Qwen3.7-Max](https://quelleia.com/modeles/qwen3-7-max.md) | Alibaba | non précisée | 34,1 % | 87,4 | https://epoch.ai/benchmarks |
| 23 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | Maximale | 31,7 % | 87,0 | https://epoch.ai/benchmarks |
| 23 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Maximale | 31,7 % | 87,0 | https://epoch.ai/benchmarks |
| 25 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Maximale | 31,7 % | 87,0 | https://epoch.ai/benchmarks |
| 26 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | Maximale | 29,3 % | 86,5 | https://epoch.ai/benchmarks |
| 26 | [GLM-5.3](https://quelleia.com/modeles/glm-5-3.md) | Z.ai (Zhipu AI) | Maximale | 29,3 % | 86,5 | https://epoch.ai/benchmarks |
| 26 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | Maximale | 29,3 % | 86,5 | https://epoch.ai/benchmarks |
| 29 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Maximale | 26,8 % | 86,0 | https://epoch.ai/benchmarks |
| 29 | [DeepSeek V4 Pro 0813](https://quelleia.com/modeles/deepseek-v4-pro-0813.md) | DeepSeek | Maximale | 26,8 % | 86,0 | https://epoch.ai/benchmarks |
| 29 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 26,8 % | 86,0 | https://epoch.ai/benchmarks |
| 29 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | Élevée | 26,8 % | 86,0 | https://epoch.ai/benchmarks |
| 33 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 25,6 % | 85,7 | https://epoch.ai/benchmarks |
| 34 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | Élevée | 24,4 % | 85,4 | https://epoch.ai/benchmarks |
| 34 | [DeepSeek V4 Flash 0731](https://quelleia.com/modeles/deepseek-v4-flash-0731.md) | DeepSeek | Maximale | 24,4 % | 85,4 | https://epoch.ai/benchmarks |
| 36 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | Élevée | 22 % | 84,8 | https://epoch.ai/benchmarks |
| 36 | [Gemini 3.6 Flash](https://quelleia.com/modeles/gemini-3-6-flash.md) | Google DeepMind | Élevée | 22 % | 84,8 | https://epoch.ai/benchmarks |
| 36 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 22 % | 84,8 | https://epoch.ai/benchmarks |
| 39 | [GPT-5 Pro](https://quelleia.com/modeles/gpt-5-pro.md) | OpenAI | Élevée | 19,5 % | 84,2 | https://epoch.ai/benchmarks |
| 40 | [GLM-5.3-Flash](https://quelleia.com/modeles/glm-5-3-flash.md) | Z.ai (Zhipu AI) | Maximale | 17,1 % | 83,5 | https://epoch.ai/benchmarks |
| 40 | [Grok 4.20](https://quelleia.com/modeles/grok-4-20.md) | xAI | non précisée | 17,1 % | 83,5 | https://epoch.ai/benchmarks |
| 40 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | non précisée | 17,1 % | 83,5 | https://epoch.ai/benchmarks |
| 40 | [Inkling-Small](https://quelleia.com/modeles/inkling-small.md) | Thinking Machines | Maximale | 17,1 % | 83,5 | https://epoch.ai/benchmarks |
| 44 | [Grok 4.3 Beta](https://quelleia.com/modeles/grok-4-3-beta.md) | xAI | Élevée | 14,6 % | 82,7 | https://epoch.ai/benchmarks |
| 45 | [Kimi K2.7 Code](https://quelleia.com/modeles/kimi-k2-7-code.md) | Moonshot | non précisée | 12,2 % | 81,8 | https://epoch.ai/benchmarks |
| 45 | [GPT-5.4 Nano](https://quelleia.com/modeles/gpt-5-4-nano.md) | OpenAI | Élevée | 12,2 % | 81,8 | https://epoch.ai/benchmarks |
| 45 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | Élevée | 12,2 % | 81,8 | https://epoch.ai/benchmarks |
| 48 | [GPT-5.4 Mini](https://quelleia.com/modeles/gpt-5-4-mini.md) | OpenAI | Maximale | 9,8 % | 80,7 | https://epoch.ai/benchmarks |
| 49 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | Budget | 4,9 % | 77,5 | https://epoch.ai/benchmarks |
| 49 | [Inkling](https://quelleia.com/modeles/inkling.md) | Thinking Machines | Maximale | 4,9 % | 77,5 | https://epoch.ai/benchmarks |
| 49 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Élevée | 4,9 % | 77,5 | https://epoch.ai/benchmarks |
| 52 | [DeepSeek-V4-Pro](https://quelleia.com/modeles/deepseek-v4-pro.md) | DeepSeek | Maximale | 2,4 % | 74,4 | https://epoch.ai/benchmarks |
| 52 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | Budget | 2,4 % | 74,4 | https://epoch.ai/benchmarks |
| 52 | [GPT-5.5 Instant](https://quelleia.com/modeles/gpt-5-5-instant.md) | OpenAI | non précisée | 2,4 % | 74,4 | https://epoch.ai/benchmarks |
| 52 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | Budget | 2,4 % | 74,4 | https://epoch.ai/benchmarks |
| 52 | [GPT-5 nano](https://quelleia.com/modeles/gpt-5-nano.md) | OpenAI | Élevée | 2,4 % | 74,4 | https://epoch.ai/benchmarks |
| 57 | [Gemini 3.5 Flash-Lite](https://quelleia.com/modeles/gemini-3-5-flash-lite.md) | Google DeepMind | Élevée | 0 % | 70,5 | https://epoch.ai/benchmarks |
| 57 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 0 % | 70,5 | https://epoch.ai/benchmarks |
| 57 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 0 % | 70,5 | https://epoch.ai/benchmarks |

## En bref

**Que mesure FrontierMath, palier 4 (v2) ?** 43 problèmes de niveau recherche, corrigés en 2026, qui peuvent occuper un mathématicien professionnel plusieurs jours. Sur Quelle IA, il est rangé dans la tâche Mathématiques.

**Comment FrontierMath, palier 4 (v2) est-il noté ?** Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé. Un modèle qui obtient 50 % a un score IA d'environ 90.

**Qui est en tête sur FrontierMath, palier 4 (v2) ?** GPT-6 Astra (OpenAI) est en tête de FrontierMath, palier 4 (v2) avec 97,6 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5.5 (95 %) et Claude Fable 5 (90,2 %). 59 modèles y sont mesurés.

**Quelles sont les limites de FrontierMath, palier 4 (v2) ?** Avec 43 problèmes, chacun pèse plus de deux points, et le meilleur modèle frôle déjà le maximum. OpenAI a financé le jeu et en détient une partie. Au 28 septembre 2026, le benchmark est saturé.

**Combien pèse FrontierMath, palier 4 (v2) dans le score IA ?** FrontierMath, palier 4 (v2) compte pour 1,25 % du score général, dans l'édition du 28 septembre 2026. Il porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks. Saturé, il garde ce poids, mais il ne départage presque plus les meilleurs modèles.

**Qui maintient FrontierMath, palier 4 (v2) ?** Epoch AI. Sa page de référence : epoch.ai/benchmarks/frontiermath.

## Les autres benchmarks de la tâche Mathématiques

- [Arena, questions de maths](https://quelleia.com/benchmarks/arena_maths.md) : 269 modèles · 1,25 % du score
- [OTIS Mock AIME 2024-2025](https://quelleia.com/benchmarks/otis_mock_aime_2024_2025.md) : 190 modèles · 1,25 % du score, saturé
- [FrontierMath, paliers 1 à 3 (v2)](https://quelleia.com/benchmarks/frontiermath_tiers_1_3_v2.md) : 77 modèles · 1,25 % du score
- [FrontierMath, paliers 1 à 3 (version 2025)](https://quelleia.com/benchmarks/frontiermath.md) : 70 modèles · 1,25 % du score
- [ProofBench](https://quelleia.com/benchmarks/proofbench.md) : 70 modèles · 1,25 % du score, saturé
- [FrontierMath, palier 4 (version 2025)](https://quelleia.com/benchmarks/frontiermath_tier_4.md) : 55 modèles · 1,25 % du score
- [FrontierMath Erdős](https://quelleia.com/benchmarks/frontiermath_erdos.md) : 5 modèles · 1,25 % du score
- [MATH Level 5](https://quelleia.com/benchmarks/math_level_5.md) : 94 modèles · hors score, archivé
- [GSM8K](https://quelleia.com/benchmarks/gsm8k.md) : 82 modèles · hors score, archivé
- [LiveBench, mathématiques](https://quelleia.com/benchmarks/livebench_maths.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
