Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

MathsFiche benchmark · Epoch AI · epoch.ai

FrontierMath, palier 4 (version 2025)

Une cinquantaine de problèmes de niveau recherche, les plus durs de FrontierMath, qui peuvent occuper un mathématicien plusieurs jours.

À quoi il sert

Sur Quelle IA, FrontierMath, palier 4 (version 2025) sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 90.

Comment c'est noté

Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé.

Pour le calcul, ce score est ramené entre 0 et 1 : 0 % vaut 0 et 60 %, le plafond retenu, vaut 1.

Ce qu'il ne dit pas

Version remplacée en juin 2026 après correction de 12 énoncés et retrait de 7 autres ; Epoch estime le score maximal à 60 %. OpenAI a financé le jeu et en détient une partie.

Comment lire le score

55 modèles mesurés · 72 mesures

En tête : AI Co-Mathematician, 47,9 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 30 % a un score IA d'environ 90. Le meilleur, AI Co-Mathematician, atteint 47,9 %. Le benchmark sera dit saturé quand un modèle atteindra 57 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
4 %
Score IA 100niveau de Claude Opus 5.5
52 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,25 %du score général. FrontierMath, palier 4 (version 2025) porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.

En couleur, la tâche Mathématiques dans le score général. En noir, la part de FrontierMath, palier 4 (version 2025).

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1AI Co-MathematicianGoogle DeepMindNon précisée47,9 %97,3
2GPT-5.5 ProOpenAI · 2 configurationsMaximale39,6 %93,6
3GPT-5.4 ProOpenAINon précisée37,5 %92,8
4GPT-5.5OpenAIMaximale35,4 %92,0
5GPT-5.2 ProOpenAINon précisée31,3 %90,6
6Claude Opus 4.8AnthropicMaximale31,3 %90,6
7GPT-5.4OpenAIMaximale27,1 %89,1
8Claude Opus 4.7AnthropicMaximale22,9 %87,6
9Claude Opus 4.6Anthropic · 4 configurationsMaximale22,9 %87,6
10GPT-5.2OpenAI · 4 configurationsÉlevée18,8 %86,0
55 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 55 →Replier le classement ↑
11Gemini 3 ProGoogle DeepMindNon précisée18,8 %86,0
12Gemini 3.1 ProGoogle DeepMindNon précisée16,7 %85,1
13Muse SparkMeta AINon précisée14,6 %84,2
13GPT-5 ProOpenAIÉlevée14,6 %84,2
15Gemini 3.5 FlashGoogle DeepMindÉlevée14,6 %84,2
16Kimi K2.6Moonshot · poids ouvertsNon précisée14,6 %84,2
17GLM-5.1Z.ai (Zhipu AI) · poids ouvertsNon précisée12,5 %83,1
17GPT-5OpenAI · 2 configurationsÉlevée12,5 %83,1
17GPT-5.1OpenAI · 2 configurationsÉlevée12,5 %83,1
20Gemini 2.5 Deep ThinkGoogle DeepMindNon précisée10,4 %81,9
21Qwen 3.6 PlusAlibabaNon précisée8,3 %80,5
22Claude Sonnet 4.6AnthropicBudget8,3 %80,5
23GPT-5.4 NanoOpenAIÉlevée6,3 %78,8
23GPT-5 miniOpenAI · 2 configurationsÉlevée6,3 %78,8
23o4-miniOpenAI · 2 configurationsÉlevée6,3 %78,8
26Kimi K2.5Moonshot · poids ouvertsNon précisée4,2 %76,5
27Gemini 3 FlashGoogle DeepMindNon précisée4,2 %76,5
27Claude Opus 4.5Anthropic · 3 configurationsNon précisée4,2 %76,5
27Qwen 3.6 Max (Preview)AlibabaNon précisée4,2 %76,5
27Claude Sonnet 4.5Anthropic · 2 configurationsBudget4,2 %76,5
27Claude Opus 4.1AnthropicBudget4,2 %76,5
27Gemini 2.5 Pro (Jun 2025)Google DeepMind · 2 configurationsNon précisée4,2 %76,5
27Claude Opus 4Anthropic · 2 configurationsBudget4,2 %76,5
27Gemini 2.5 Flash (Jun 2025)Google DeepMindNon précisée4,2 %76,5
27o3-miniOpenAIÉlevée4,2 %76,5
36GLM-4.6Z.ai (Zhipu AI) · poids ouvertsNon précisée2,1 %72,8
37GLM-5Z.ai (Zhipu AI) · poids ouvertsNon précisée2,1 %72,7
37DeepSeek-V3.2DeepSeek · poids ouvertsNon précisée2,1 %72,7
39o3OpenAIÉlevée2,1 %72,7
39Grok 4xAINon précisée2,1 %72,7
39Qwen 3.5 Plus (hosted 397B-A17B)AlibabaNon précisée2,1 %72,7
39Claude Haiku 4.5AnthropicBudget2,1 %72,7
39GPT-5 nanoOpenAI · 2 configurationsMoyenne2,1 %72,7
44GPT-5.4 MiniOpenAIÉlevée2,1 %72,7
44Grok 4 HeavyxAINon précisée2,1 %72,7
46GLM-4.7Z.ai (Zhipu AI) · poids ouvertsNon précisée0 %66,0
46Kimi K2 ThinkingMoonshot · poids ouvertsNon précisée0 %66,0
46Qwen 3.6 FlashAlibabaNon précisée0 %66,0
46Claude Sonnet 4AnthropicNon précisée0 %66,0
46Qwen 3.5 Flash (hosted 35B-A3B)AlibabaNon précisée0 %66,0
46Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée0 %66,0
46Grok 3xAINon précisée0 %66,0
46GPT-4.1OpenAINon précisée0 %66,0
46Claude 3.5 SonnetAnthropicNon précisée0 %66,0
46Claude 3.5 Sonnet (October 2024)AnthropicNon précisée0 %66,0

En bref

Que mesure FrontierMath, palier 4 (version 2025) ?
Une cinquantaine de problèmes de niveau recherche, les plus durs de FrontierMath, qui peuvent occuper un mathématicien plusieurs jours. Sur Quelle IA, il est rangé dans la tâche Mathématiques.
Comment FrontierMath, palier 4 (version 2025) est-il noté ?
Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé. Un modèle qui obtient 30 % a un score IA d'environ 90.
Qui est en tête sur FrontierMath, palier 4 (version 2025) ?
AI Co-Mathematician (Google DeepMind) est en tête de FrontierMath, palier 4 (version 2025) avec 47,9 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.5 Pro (39,6 %) et GPT-5.4 Pro (37,5 %). 55 modèles y sont mesurés.
Quelles sont les limites de FrontierMath, palier 4 (version 2025) ?
Version remplacée en juin 2026 après correction de 12 énoncés et retrait de 7 autres ; Epoch estime le score maximal à 60 %. OpenAI a financé le jeu et en détient une partie. Au 28 septembre 2026, le benchmark est actif.
Combien pèse FrontierMath, palier 4 (version 2025) dans le score IA ?
FrontierMath, palier 4 (version 2025) compte pour 1,25 % du score général, dans l'édition du 28 septembre 2026. Il porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.
Qui maintient FrontierMath, palier 4 (version 2025) ?
Epoch AI. Sa page de référence : epoch.ai/benchmarks/frontiermath.

Les autres benchmarks de la tâche Mathématiques

Tous les benchmarks →Comment le score IA est calculé →