# FrontierMath, paliers 1 à 3 (v2)

> Fiche du benchmark FrontierMath, paliers 1 à 3 (v2) sur Quelle IA, édition du 28 septembre 2026. 295 problèmes de mathématiques inédits et corrigés en 2026, du niveau licence avancée à celui d'un chercheur. En tête au 28 septembre 2026 : GPT-6 Astra (93,7 %). Notation, limites et classement des 77 modèles mesurés.

Page : https://quelleia.com/benchmarks/frontiermath_tiers_1_3_v2/
Source du benchmark : https://epoch.ai/benchmarks/frontiermath
Mainteneur : Epoch AI
Tâche : Mathématiques
État : actif

## À quoi il sert

Sur Quelle IA, FrontierMath, paliers 1 à 3 (v2) sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 82.

## Comment c'est noté

Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé.

## Ce qu'il ne dit pas

Le jeu est privé, donc peu exposé aux fuites, mais OpenAI l'a financé et a accès à une partie des problèmes. Les meilleurs modèles dépassent déjà 90 %.

## Qui le tient

Epoch AI.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 82. Le meilleur, GPT-6 Astra, atteint 93,7 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 2 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 33 %
- Score IA 100 (niveau de Claude Opus 5.5) : 91 %

## Son poids dans le score IA

1,25 % du score général. FrontierMath, paliers 1 à 3 (v2) porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.

## Classement (77 modèles mesurés · 110 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | Maximale | 93,7 % | 102,4 | https://epoch.ai/benchmarks |
| 2 | [Claude Opus 5.5](https://quelleia.com/modeles/claude-opus-5-5.md) | Anthropic | Maximale | 91,2 % | 99,7 | https://epoch.ai/benchmarks |
| 3 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | Maximale | 90,2 % | 98,7 | https://epoch.ai/benchmarks |
| 4 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 89,1 % | 97,8 | https://epoch.ai/benchmarks |
| 5 | [Claude Sonnet 5.5](https://quelleia.com/modeles/claude-sonnet-5-5.md) | Anthropic | Maximale | 88,8 % | 97,6 | https://epoch.ai/benchmarks |
| 6 | [GPT-5.5 Pro](https://quelleia.com/modeles/gpt-5-5-pro.md) | OpenAI | Maximale | 87,7 % | 96,8 | https://epoch.ai/benchmarks |
| 7 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Maximale | 87 % | 96,3 | https://epoch.ai/benchmarks |
| 8 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 86 % | 95,6 | https://epoch.ai/benchmarks |
| 9 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 85,6 % | 95,4 | https://epoch.ai/benchmarks |
| 10 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 85,3 % | 95,2 | https://epoch.ai/benchmarks |
| 11 | [GPT-5.4 Pro](https://quelleia.com/modeles/gpt-5-4-pro.md) | OpenAI | Maximale | 82,5 % | 93,6 | https://epoch.ai/benchmarks |
| 12 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | Maximale | 82,1 % | 93,4 | https://epoch.ai/benchmarks |
| 13 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 80 % | 92,4 | https://epoch.ai/benchmarks |
| 14 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 78,6 % | 91,7 | https://epoch.ai/benchmarks |
| 15 | [Qwen 3.8 Max](https://quelleia.com/modeles/qwen-3-8-max.md) | Alibaba | Maximale | 74,7 % | 90,1 | https://epoch.ai/benchmarks |
| 16 | [Muse Spark 1.3](https://quelleia.com/modeles/muse-spark-1-3.md) | Meta AI | Maximale | 74,4 % | 89,9 | https://epoch.ai/benchmarks |
| 17 | [GPT-5.2 Pro](https://quelleia.com/modeles/gpt-5-2-pro.md) | OpenAI | Maximale | 74 % | 89,8 | https://epoch.ai/benchmarks |
| 18 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | Maximale | 72,2 % | 89,1 | https://epoch.ai/benchmarks |
| 19 | [Gemini 3.7 Flash](https://quelleia.com/modeles/gemini-3-7-flash.md) | Google DeepMind | Élevée | 71,6 % | 88,8 | https://epoch.ai/benchmarks |
| 20 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Maximale | 70,2 % | 88,3 | https://epoch.ai/benchmarks |
| 21 | [GLM-5.3](https://quelleia.com/modeles/glm-5-3.md) | Z.ai (Zhipu AI) | Maximale | 68,8 % | 87,8 | https://epoch.ai/benchmarks |
| 22 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | Élevée | 68,4 % | 87,7 | https://epoch.ai/benchmarks |
| 23 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Maximale | 67,4 % | 87,3 | https://epoch.ai/benchmarks |
| 24 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | Maximale | 66 % | 86,8 | https://epoch.ai/benchmarks |
| 24 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Maximale | 66 % | 86,8 | https://epoch.ai/benchmarks |
| 26 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | Maximale | 65,6 % | 86,7 | https://epoch.ai/benchmarks |
| 26 | [Qwen3.8 Max (0902)](https://quelleia.com/modeles/qwen3-8-max-0902.md) | Alibaba | Maximale | 65,6 % | 86,7 | https://epoch.ai/benchmarks |
| 28 | [DeepSeek V4 Pro 0813](https://quelleia.com/modeles/deepseek-v4-pro-0813.md) | DeepSeek | Maximale | 64,6 % | 86,3 | https://epoch.ai/benchmarks |
| 28 | [Qwen3.7-Max](https://quelleia.com/modeles/qwen3-7-max.md) | Alibaba | non précisée | 64,6 % | 86,3 | https://epoch.ai/benchmarks |
| 30 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | Élevée | 62,8 % | 85,8 | https://epoch.ai/benchmarks |
| 31 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 59,6 % | 84,8 | https://epoch.ai/benchmarks |
| 32 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | Maximale | 59,2 % | 84,6 | https://epoch.ai/benchmarks |
| 33 | [Gemini 3.6 Flash](https://quelleia.com/modeles/gemini-3-6-flash.md) | Google DeepMind | Élevée | 58,9 % | 84,5 | https://epoch.ai/benchmarks |
| 34 | [DeepSeek V4 Flash 0731](https://quelleia.com/modeles/deepseek-v4-flash-0731.md) | DeepSeek | Maximale | 57,5 % | 84,1 | https://epoch.ai/benchmarks |
| 35 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | Élevée | 57,2 % | 84,0 | https://epoch.ai/benchmarks |
| 35 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 57,2 % | 84,0 | https://epoch.ai/benchmarks |
| 37 | [GLM-5.3-Flash](https://quelleia.com/modeles/glm-5-3-flash.md) | Z.ai (Zhipu AI) | Maximale | 55,8 % | 83,5 | https://epoch.ai/benchmarks |
| 37 | [GPT-5 Pro](https://quelleia.com/modeles/gpt-5-pro.md) | OpenAI | Élevée | 55,8 % | 83,5 | https://epoch.ai/benchmarks |
| 39 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 55,4 % | 83,4 | https://epoch.ai/benchmarks |
| 40 | [Kimi K2.7 Code](https://quelleia.com/modeles/kimi-k2-7-code.md) | Moonshot | non précisée | 54 % | 83,0 | https://epoch.ai/benchmarks |
| 41 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | non précisée | 51,2 % | 82,1 | https://epoch.ai/benchmarks |
| 41 | [GPT-5.4 Mini](https://quelleia.com/modeles/gpt-5-4-mini.md) | OpenAI | Maximale | 51,2 % | 82,1 | https://epoch.ai/benchmarks |
| 43 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | Élevée | 46,7 % | 80,7 | https://epoch.ai/benchmarks |
| 44 | [Inkling-Small](https://quelleia.com/modeles/inkling-small.md) | Thinking Machines | Maximale | 46,3 % | 80,6 | https://epoch.ai/benchmarks |
| 45 | [DeepSeek-V4-Pro](https://quelleia.com/modeles/deepseek-v4-pro.md) | DeepSeek | Maximale | 45,3 % | 80,3 | https://epoch.ai/benchmarks |
| 46 | [Grok 4.20](https://quelleia.com/modeles/grok-4-20.md) | xAI | non précisée | 44,9 % | 80,2 | https://epoch.ai/benchmarks |
| 46 | [GPT-5.4 Nano](https://quelleia.com/modeles/gpt-5-4-nano.md) | OpenAI | Élevée | 44,9 % | 80,2 | https://epoch.ai/benchmarks |
| 48 | [Grok 4.3 Beta](https://quelleia.com/modeles/grok-4-3-beta.md) | xAI | Élevée | 42,8 % | 79,5 | https://epoch.ai/benchmarks |
| 49 | [Qwen 3.6 Plus](https://quelleia.com/modeles/qwen-3-6-plus.md) | Alibaba | non précisée | 38,2 % | 78,1 | https://epoch.ai/benchmarks |
| 50 | [GLM-5.1](https://quelleia.com/modeles/glm-5-1.md) | Z.ai (Zhipu AI) | non précisée | 36,8 % | 77,6 | https://epoch.ai/benchmarks |
| 51 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Élevée | 36,1 % | 77,4 | https://epoch.ai/benchmarks |
| 52 | [Qwen3.6 27B](https://quelleia.com/modeles/qwen3-6-27b.md) | Alibaba | non précisée | 35,1 % | 77,1 | https://epoch.ai/benchmarks |
| 53 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | Budget | 34,4 % | 76,8 | https://epoch.ai/benchmarks |
| 53 | [Qwen3.7-Plus](https://quelleia.com/modeles/qwen3-7-plus.md) | Alibaba | Sans | 34,4 % | 76,8 | https://epoch.ai/benchmarks |
| 55 | [Inkling](https://quelleia.com/modeles/inkling.md) | Thinking Machines | Maximale | 33,3 % | 76,5 | https://epoch.ai/benchmarks |
| 55 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Élevée | 33,3 % | 76,5 | https://epoch.ai/benchmarks |
| 57 | [Qwen3.5 397B-A17B](https://quelleia.com/modeles/qwen3-5-397b-a17b.md) | Alibaba | Sans | 31,2 % | 75,7 | https://epoch.ai/benchmarks |
| 58 | [Gemini 3.1 Flash-Lite](https://quelleia.com/modeles/gemini-3-1-flash-lite.md) | Google DeepMind | Élevée | 27,7 % | 74,4 | https://epoch.ai/benchmarks |
| 59 | [GPT-5.5 Instant](https://quelleia.com/modeles/gpt-5-5-instant.md) | OpenAI | non précisée | 26,3 % | 73,9 | https://epoch.ai/benchmarks |
| 60 | [Gemini 3.5 Flash-Lite](https://quelleia.com/modeles/gemini-3-5-flash-lite.md) | Google DeepMind | Élevée | 26 % | 73,7 | https://epoch.ai/benchmarks |
| 61 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 24,6 % | 73,2 | https://epoch.ai/benchmarks |
| 62 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | Budget | 23,9 % | 72,9 | https://epoch.ai/benchmarks |
| 63 | [Qwen 3.6 Flash](https://quelleia.com/modeles/qwen-3-6-flash.md) | Alibaba | Sans | 22,5 % | 72,3 | https://epoch.ai/benchmarks |
| 64 | [Qwen 3.6 35B-A3B](https://quelleia.com/modeles/qwen-3-6-35b-a3b.md) | Alibaba | Sans | 20,4 % | 71,3 | https://epoch.ai/benchmarks |
| 65 | [GPT-5 nano](https://quelleia.com/modeles/gpt-5-nano.md) | OpenAI | Élevée | 20 % | 71,2 | https://epoch.ai/benchmarks |
| 66 | [Qwen3.7 Flash](https://quelleia.com/modeles/qwen3-7-flash.md) | Alibaba | non précisée | 19,3 % | 70,8 | https://epoch.ai/benchmarks |
| 67 | [Qwen3-Max](https://quelleia.com/modeles/qwen3-max.md) | Alibaba | non précisée | 18,9 % | 70,6 | https://epoch.ai/benchmarks |
| 68 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 18,6 % | 70,5 | https://epoch.ai/benchmarks |
| 69 | [Qwen 3.5 Flash (hosted 35B-A3B)](https://quelleia.com/modeles/qwen-3-5-flash-hosted-35b-a3b.md) | Alibaba | Sans | 18,2 % | 70,3 | https://epoch.ai/benchmarks |
| 70 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Élevée | 14,7 % | 68,3 | https://epoch.ai/benchmarks |
| 71 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | Budget | 12,6 % | 67,0 | https://epoch.ai/benchmarks |
| 72 | [GPT-4.1 mini](https://quelleia.com/modeles/gpt-4-1-mini.md) | OpenAI | non précisée | 6,7 % | 61,6 | https://epoch.ai/benchmarks |
| 73 | [GPT-4.1](https://quelleia.com/modeles/gpt-4-1.md) | OpenAI | non précisée | 6 % | 60,7 | https://epoch.ai/benchmarks |
| 74 | [GPT-4 Turbo (Apr 2024)](https://quelleia.com/modeles/gpt-4-turbo-apr-2024.md) | OpenAI | non précisée | 0,7 % | 46,6 | https://epoch.ai/benchmarks |
| 74 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 0,7 % | 46,6 | https://epoch.ai/benchmarks |
| 76 | [GPT-4o (Aug 2024)](https://quelleia.com/modeles/gpt-4o-aug-2024.md) | OpenAI | non précisée | 0,4 % | 46,6 | https://epoch.ai/benchmarks |
| 77 | [GPT-3.5 Turbo (Jan 2024)](https://quelleia.com/modeles/gpt-3-5-turbo-jan-2024.md) | OpenAI | non précisée | 0 % | 46,6 | https://epoch.ai/benchmarks |

## En bref

**Que mesure FrontierMath, paliers 1 à 3 (v2) ?** 295 problèmes de mathématiques inédits et corrigés en 2026, du niveau licence avancée à celui d'un chercheur. Sur Quelle IA, il est rangé dans la tâche Mathématiques.

**Comment FrontierMath, paliers 1 à 3 (v2) est-il noté ?** Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé. Un modèle qui obtient 50 % a un score IA d'environ 82.

**Qui est en tête sur FrontierMath, paliers 1 à 3 (v2) ?** GPT-6 Astra (OpenAI) est en tête de FrontierMath, paliers 1 à 3 (v2) avec 93,7 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5.5 (91,2 %) et Claude Fable 5.1 (90,2 %). 77 modèles y sont mesurés.

**Quelles sont les limites de FrontierMath, paliers 1 à 3 (v2) ?** Le jeu est privé, donc peu exposé aux fuites, mais OpenAI l'a financé et a accès à une partie des problèmes. Les meilleurs modèles dépassent déjà 90 %. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse FrontierMath, paliers 1 à 3 (v2) dans le score IA ?** FrontierMath, paliers 1 à 3 (v2) compte pour 1,25 % du score général, dans l'édition du 28 septembre 2026. Il porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.

**Qui maintient FrontierMath, paliers 1 à 3 (v2) ?** Epoch AI. Sa page de référence : epoch.ai/benchmarks/frontiermath.

## Les autres benchmarks de la tâche Mathématiques

- [Arena, questions de maths](https://quelleia.com/benchmarks/arena_maths.md) : 269 modèles · 1,25 % du score
- [OTIS Mock AIME 2024-2025](https://quelleia.com/benchmarks/otis_mock_aime_2024_2025.md) : 190 modèles · 1,25 % du score, saturé
- [FrontierMath, paliers 1 à 3 (version 2025)](https://quelleia.com/benchmarks/frontiermath.md) : 70 modèles · 1,25 % du score
- [ProofBench](https://quelleia.com/benchmarks/proofbench.md) : 70 modèles · 1,25 % du score, saturé
- [FrontierMath, palier 4 (v2)](https://quelleia.com/benchmarks/frontiermath_tier_4_v2.md) : 59 modèles · 1,25 % du score, saturé
- [FrontierMath, palier 4 (version 2025)](https://quelleia.com/benchmarks/frontiermath_tier_4.md) : 55 modèles · 1,25 % du score
- [FrontierMath Erdős](https://quelleia.com/benchmarks/frontiermath_erdos.md) : 5 modèles · 1,25 % du score
- [MATH Level 5](https://quelleia.com/benchmarks/math_level_5.md) : 94 modèles · hors score, archivé
- [GSM8K](https://quelleia.com/benchmarks/gsm8k.md) : 82 modèles · hors score, archivé
- [LiveBench, mathématiques](https://quelleia.com/benchmarks/livebench_maths.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
