Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

MathsFiche benchmark · Epoch AI · epoch.ai

FrontierMath, paliers 1 à 3 (version 2025)

Environ 300 problèmes de mathématiques inédits, écrits par des mathématiciens, qui demandent chacun plusieurs heures à un spécialiste.

À quoi il sert

Sur Quelle IA, FrontierMath, paliers 1 à 3 (version 2025) sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 80.

Comment c'est noté

Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé.

Pour le calcul, ce score est ramené entre 0 et 1 : 0 % vaut 0 et 57 %, le plafond retenu, vaut 1.

Ce qu'il ne dit pas

Version remplacée en juin 2026 : plus de quatre énoncés sur dix ont dû être corrigés, et Epoch estime le score maximal à 57 %. OpenAI a financé le jeu et en détient une partie.

Comment lire le score

70 modèles mesurés · 101 mesures

En tête : GPT-5.5 Pro, 52,4 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 28 % a un score IA d'environ 80. Le meilleur, GPT-5.5 Pro, atteint 52,4 %. Le benchmark sera dit saturé quand un modèle atteindra 54,1 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
20 %
Score IA 100niveau de Claude Opus 5.5
55 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,25 %du score général. FrontierMath, paliers 1 à 3 (version 2025) porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.

En couleur, la tâche Mathématiques dans le score général. En noir, la part de FrontierMath, paliers 1 à 3 (version 2025).

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-5.5 ProOpenAI · 2 configurationsÉlevée52,4 %94,9
2GPT-5.5OpenAIMaximale51,7 %94,0
3GPT-5.4 ProOpenAIMaximale50 %92,1
4GPT-5.4OpenAIMaximale47,6 %90,0
5Claude Opus 4.8AnthropicMaximale47,2 %89,7
6Claude Opus 4.7AnthropicMaximale43,8 %87,5
7Claude Opus 4.6Anthropic · 4 configurationsMaximale40,7 %85,7
7GPT-5.2OpenAI · 4 configurationsMaximale40,7 %85,7
9Muse SparkMeta AINon précisée39 %84,9
10Gemini 3.5 FlashGoogle DeepMindÉlevée39 %84,9
70 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 70 →Replier le classement ↑
10Kimi K2.6Moonshot · poids ouvertsNon précisée39 %84,9
12Gemini 3 ProGoogle DeepMindNon précisée37,6 %84,2
13Gemini 3.1 ProGoogle DeepMindNon précisée36,9 %83,9
14Gemini 3 FlashGoogle DeepMindNon précisée35,6 %83,3
15GLM-5.1Z.ai (Zhipu AI) · poids ouvertsNon précisée33,4 %82,3
16GPT-5OpenAI · 2 configurationsÉlevée32,4 %81,9
17Claude Sonnet 4.6AnthropicBudget32,4 %81,9
18GPT-5.1OpenAI · 4 configurationsÉlevée31 %81,3
19Gemini 2.5 Deep ThinkGoogle DeepMindNon précisée29 %80,4
20GPT-5.4 MiniOpenAIÉlevée28,3 %80,1
21Kimi K2.5Moonshot · poids ouvertsNon précisée27,9 %80,0
22GPT-5 miniOpenAI · 2 configurationsÉlevée27,2 %79,7
23Qwen 3.6 PlusAlibabaNon précisée26,2 %79,2
24GPT-5.4 NanoOpenAIÉlevée25,9 %79,1
25o4-miniOpenAI · 3 configurationsÉlevée24,8 %78,6
26Qwen 3.6 Max (Preview)AlibabaNon précisée23,1 %77,9
27DeepSeek-V3.2DeepSeek · poids ouvertsNon précisée22,1 %77,5
28Kimi K2 ThinkingMoonshot · poids ouvertsNon précisée21,4 %77,1
29Qwen 3.5 Plus (hosted 397B-A17B)AlibabaNon précisée21 %77,0
30Claude Opus 4.5Anthropic · 3 configurationsNon précisée20,7 %76,8
31Grok 4xAINon précisée19,7 %76,3
32o3OpenAI · 3 configurationsÉlevée18,7 %75,9
33GLM-5Z.ai (Zhipu AI) · poids ouvertsNon précisée16,4 %74,8
34Claude Sonnet 4.5Anthropic · 3 configurationsBudget15,2 %74,1
35Gemini 2.5 Pro (Jun 2025)Google DeepMind · 2 configurationsNon précisée14,1 %73,5
36o3-miniOpenAI · 2 configurationsÉlevée12,4 %72,5
37Qwen 3.6 FlashAlibabaNon précisée10,3 %71,1
38o1OpenAIÉlevée9,3 %70,3
39Qwen3-235B-A22B-Thinking (Jul 2025)AlibabaNon précisée8,5 %69,7
40GPT-5 nanoOpenAI · 2 configurationsÉlevée8,3 %69,5
41Claude Opus 4.1Anthropic · 2 configurationsBudget7,2 %68,6
42Qwen 3.5 Flash (hosted 35B-A3B)AlibabaNon précisée6,2 %67,5
43Claude Haiku 4.5Anthropic · 2 configurationsBudget5,9 %67,2
44Grok-3 minixAI · 2 configurationsÉlevée5,9 %67,1
45GPT-4.1OpenAINon précisée5,5 %66,7
46Gemini 2.5 Flash (Jun 2025)Google DeepMindNon précisée4,8 %65,8
47Claude Opus 4Anthropic · 2 configurationsNon précisée4,5 %65,3
47GPT-4.1 miniOpenAINon précisée4,5 %65,3
49Claude Sonnet 4AnthropicNon précisée4,1 %64,8
49Claude 3.7 SonnetAnthropic · 4 configurationsBudget4,1 %64,8
51GLM-4.6Z.ai (Zhipu AI) · poids ouvertsNon précisée3,8 %64,3
52Grok 3xAINon précisée3,8 %64,2
53GLM-4.7Z.ai (Zhipu AI) · poids ouvertsNon précisée2,4 %61,4
54Claude 3.5 Sonnet (October 2024)AnthropicNon précisée2,1 %60,4
55Qwen Plus (Apr 2025)AlibabaNon précisée1,7 %59,3
55o1-miniOpenAI · 2 configurationsMoyenne1,7 %59,3
55Gemini 2.0 Flash (Feb 2025)Google DeepMindNon précisée1,7 %59,3
55DeepSeek-V3DeepSeek · poids ouvertsNon précisée1,7 %59,3
59Qwen2.5-MaxAlibabaNon précisée1 %56,1
59Claude 3.5 SonnetAnthropicNon précisée1 %56,1
59GPT-4.1 nanoOpenAINon précisée1 %56,1
62Llama 4 MaverickMeta AI · poids ouvertsNon précisée0,7 %53,6
62Grok-2 (Dec 2024)xAINon précisée0,7 %53,6
64Mistral Medium 3Mistral AINon précisée0,3 %52,4
65GPT-4o (Aug 2024)OpenAINon précisée0,3 %52,4
65Mistral Large 2 (Nov 2024)Mistral AI · poids ouvertsNon précisée0,3 %52,4
65GPT-4o (Nov 2024)OpenAINon précisée0,3 %52,4
65Claude 3.5 HaikuAnthropicNon précisée0,3 %52,4
69Llama 4 ScoutMeta AI · poids ouvertsNon précisée0 %52,4
69Gemini 1.5 Flash (Sep 2024)Google DeepMindNon précisée0 %52,4

En bref

Que mesure FrontierMath, paliers 1 à 3 (version 2025) ?
Environ 300 problèmes de mathématiques inédits, écrits par des mathématiciens, qui demandent chacun plusieurs heures à un spécialiste. Sur Quelle IA, il est rangé dans la tâche Mathématiques.
Comment FrontierMath, paliers 1 à 3 (version 2025) est-il noté ?
Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé. Un modèle qui obtient 28 % a un score IA d'environ 80.
Qui est en tête sur FrontierMath, paliers 1 à 3 (version 2025) ?
GPT-5.5 Pro (OpenAI) est en tête de FrontierMath, paliers 1 à 3 (version 2025) avec 52,4 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.5 (51,7 %) et GPT-5.4 Pro (50 %). 70 modèles y sont mesurés.
Quelles sont les limites de FrontierMath, paliers 1 à 3 (version 2025) ?
Version remplacée en juin 2026 : plus de quatre énoncés sur dix ont dû être corrigés, et Epoch estime le score maximal à 57 %. OpenAI a financé le jeu et en détient une partie. Au 28 septembre 2026, le benchmark est actif.
Combien pèse FrontierMath, paliers 1 à 3 (version 2025) dans le score IA ?
FrontierMath, paliers 1 à 3 (version 2025) compte pour 1,25 % du score général, dans l'édition du 28 septembre 2026. Il porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.
Qui maintient FrontierMath, paliers 1 à 3 (version 2025) ?
Epoch AI. Sa page de référence : epoch.ai/benchmarks/frontiermath.

Les autres benchmarks de la tâche Mathématiques

Tous les benchmarks →Comment le score IA est calculé →