Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

MathsFiche benchmark · Epoch AI · epoch.ai

FrontierMath, paliers 1 à 3 (v2)

295 problèmes de mathématiques inédits et corrigés en 2026, du niveau licence avancée à celui d'un chercheur.

À quoi il sert

Sur Quelle IA, FrontierMath, paliers 1 à 3 (v2) sert à noter la tâche Mathématiques : c'est l'un de ses 8 benchmarks. Il départage surtout les modèles dont le score IA approche 82.

Comment c'est noté

Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé.

Ce qu'il ne dit pas

Le jeu est privé, donc peu exposé aux fuites, mais OpenAI l'a financé et a accès à une partie des problèmes. Les meilleurs modèles dépassent déjà 90 %.

Comment lire le score

77 modèles mesurés · 110 mesures

En tête : GPT-6 Astra, 93,7 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 82. Le meilleur, GPT-6 Astra, atteint 93,7 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
2 %
Score IA 76niveau de Claude Sonnet 4.5
33 %
Score IA 100niveau de Claude Opus 5.5
91 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,25 %du score général. FrontierMath, paliers 1 à 3 (v2) porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.

En couleur, la tâche Mathématiques dans le score général. En noir, la part de FrontierMath, paliers 1 à 3 (v2).

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAIMaximale93,7 %102,4
2Claude Opus 5.5AnthropicMaximale91,2 %99,7
3Claude Fable 5.1AnthropicMaximale90,2 %98,7
4GPT-5.6 SolOpenAIMaximale89,1 %97,8
5Claude Sonnet 5.5AnthropicMaximale88,8 %97,6
6GPT-5.5 ProOpenAIMaximale87,7 %96,8
7Claude Fable 5AnthropicMaximale87 %96,3
8GPT-5.6 TerraOpenAIMaximale86 %95,6
9Claude Opus 5AnthropicMaximale85,6 %95,4
10GPT-5.5OpenAIMaximale85,3 %95,2
77 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 77 →Replier le classement ↑
11GPT-5.4 ProOpenAIMaximale82,5 %93,6
12GPT-5.6 LunaOpenAI · 3 configurationsMaximale82,1 %93,4
13Claude Opus 4.8AnthropicMaximale80 %92,4
14GPT-5.4OpenAIMaximale78,6 %91,7
15Qwen 3.8 MaxAlibabaMaximale74,7 %90,1
16Muse Spark 1.3Meta AI · 2 configurationsMaximale74,4 %89,9
17GPT-5.2 ProOpenAIMaximale74 %89,8
18Kimi K3Moonshot · poids ouvertsMaximale72,2 %89,1
19Gemini 3.7 FlashGoogle DeepMindÉlevée71,6 %88,8
20Claude Opus 4.7AnthropicMaximale70,2 %88,3
21GLM-5.3Z.ai (Zhipu AI) · poids ouvertsMaximale68,8 %87,8
22Gemini 3.8 FlashGoogle DeepMindÉlevée68,4 %87,7
23GPT-5.2OpenAIMaximale67,4 %87,3
24Grok 4.6xAIMaximale66 %86,8
24Claude Opus 4.6AnthropicMaximale66 %86,8
26Claude Sonnet 5AnthropicMaximale65,6 %86,7
26Qwen3.8 Max (0902)AlibabaMaximale65,6 %86,7
28DeepSeek V4 Pro 0813DeepSeek · poids ouvertsMaximale64,6 %86,3
28Qwen3.7-MaxAlibabaNon précisée64,6 %86,3
30Gemini 3.5 FlashGoogle DeepMindÉlevée62,8 %85,8
31Gemini 3.1 ProGoogle DeepMindNon précisée59,6 %84,8
32GLM-5.2Z.ai (Zhipu AI) · poids ouverts · 3 configurationsMaximale59,2 %84,6
33Gemini 3.6 FlashGoogle DeepMindÉlevée58,9 %84,5
34DeepSeek V4 Flash 0731DeepSeek · poids ouvertsMaximale57,5 %84,1
35Grok 4.5xAIÉlevée57,2 %84,0
35Kimi K2.6Moonshot · poids ouvertsNon précisée57,2 %84,0
37GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsMaximale55,8 %83,5
37GPT-5 ProOpenAIÉlevée55,8 %83,5
39GPT-5OpenAI · 3 configurationsÉlevée55,4 %83,4
40Kimi K2.7 CodeMoonshot · poids ouvertsNon précisée54 %83,0
41Gemini 3 FlashGoogle DeepMindNon précisée51,2 %82,1
41GPT-5.4 MiniOpenAI · 3 configurationsMaximale51,2 %82,1
43GPT-5 miniOpenAI · 3 configurationsÉlevée46,7 %80,7
44Inkling-SmallThinking Machines · poids ouvertsMaximale46,3 %80,6
45DeepSeek-V4-ProDeepSeek · poids ouvertsMaximale45,3 %80,3
46Grok 4.20xAINon précisée44,9 %80,2
46GPT-5.4 NanoOpenAI · 3 configurationsÉlevée44,9 %80,2
48Grok 4.3 BetaxAIÉlevée42,8 %79,5
49Qwen 3.6 PlusAlibaba · 2 configurationsNon précisée38,2 %78,1
50GLM-5.1Z.ai (Zhipu AI) · poids ouverts · 2 configurationsNon précisée36,8 %77,6
51o4-miniOpenAI · 3 configurationsÉlevée36,1 %77,4
52Qwen3.6 27BAlibaba · poids ouverts · 2 configurationsNon précisée35,1 %77,1
53Claude Opus 4.5AnthropicBudget34,4 %76,8
53Qwen3.7-PlusAlibabaSans34,4 %76,8
55InklingThinking Machines · poids ouvertsMaximale33,3 %76,5
55o3OpenAI · 3 configurationsÉlevée33,3 %76,5
57Qwen3.5 397B-A17BAlibaba · poids ouverts · 2 configurationsSans31,2 %75,7
58Gemini 3.1 Flash-LiteGoogle DeepMind · 3 configurationsÉlevée27,7 %74,4
59GPT-5.5 InstantOpenAINon précisée26,3 %73,9
60Gemini 3.5 Flash-LiteGoogle DeepMindÉlevée26 %73,7
61Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée24,6 %73,2
62Claude Sonnet 4.5AnthropicBudget23,9 %72,9
63Qwen 3.6 FlashAlibaba · 2 configurationsSans22,5 %72,3
64Qwen 3.6 35B-A3BAlibaba · poids ouverts · 2 configurationsSans20,4 %71,3
65GPT-5 nanoOpenAI · 3 configurationsÉlevée20 %71,2
66Qwen3.7 FlashAlibaba · 2 configurationsNon précisée19,3 %70,8
67Qwen3-MaxAlibabaNon précisée18,9 %70,6
68o3-miniOpenAI · 3 configurationsÉlevée18,6 %70,5
69Qwen 3.5 Flash (hosted 35B-A3B)Alibaba · 2 configurationsSans18,2 %70,3
70o1OpenAI · 3 configurationsÉlevée14,7 %68,3
71Claude Opus 4.1AnthropicBudget12,6 %67,0
72GPT-4.1 miniOpenAINon précisée6,7 %61,6
73GPT-4.1OpenAINon précisée6 %60,7
74GPT-4 Turbo (Apr 2024)OpenAINon précisée0,7 %46,6
74GPT-4o miniOpenAINon précisée0,7 %46,6
76GPT-4o (Aug 2024)OpenAINon précisée0,4 %46,6
77GPT-3.5 Turbo (Jan 2024)OpenAINon précisée0 %46,6

En bref

Que mesure FrontierMath, paliers 1 à 3 (v2) ?
295 problèmes de mathématiques inédits et corrigés en 2026, du niveau licence avancée à celui d'un chercheur. Sur Quelle IA, il est rangé dans la tâche Mathématiques.
Comment FrontierMath, paliers 1 à 3 (v2) est-il noté ?
Un point par réponse exacte, vérifiée par programme ; le score est la part de problèmes résolus sur le jeu privé. Un modèle qui obtient 50 % a un score IA d'environ 82.
Qui est en tête sur FrontierMath, paliers 1 à 3 (v2) ?
GPT-6 Astra (OpenAI) est en tête de FrontierMath, paliers 1 à 3 (v2) avec 93,7 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5.5 (91,2 %) et Claude Fable 5.1 (90,2 %). 77 modèles y sont mesurés.
Quelles sont les limites de FrontierMath, paliers 1 à 3 (v2) ?
Le jeu est privé, donc peu exposé aux fuites, mais OpenAI l'a financé et a accès à une partie des problèmes. Les meilleurs modèles dépassent déjà 90 %. Au 28 septembre 2026, le benchmark est actif.
Combien pèse FrontierMath, paliers 1 à 3 (v2) dans le score IA ?
FrontierMath, paliers 1 à 3 (v2) compte pour 1,25 % du score général, dans l'édition du 28 septembre 2026. Il porte 13 % de la tâche Mathématiques (10 % du score général), que se partagent 8 benchmarks.
Qui maintient FrontierMath, paliers 1 à 3 (v2) ?
Epoch AI. Sa page de référence : epoch.ai/benchmarks/frontiermath.

Les autres benchmarks de la tâche Mathématiques

Tous les benchmarks →Comment le score IA est calculé →